XPeng veröffentlicht TuringViT für Smart Driving und Robotik
Der Autohersteller XPeng hat TuringViT veröffentlicht, einen Vision Encoder für Smart Driving, Cockpit-Systeme und sein IRON Humanoide Roboterprogramm.

Der Autohersteller XPeng hat TuringViT veröffentlicht, einen Vision Encoder, der für Anwendungen im Bereich Smart Driving, intelligente Cockpit-Systeme und das Humanoide Roboterprogramm IRON des Unternehmens konzipiert ist.
TuringViT ist für den Einsatz in Vision-Language- und Vision-Language-Action-Modellen vorgesehen. XPeng bietet das Modell in zwei Varianten an: TuringViT-18L und TuringViT-24L. Das Unternehmen gab an, dass TuringViT-18L bei einer Auflösung von 1536x1536 eine erheblich höhere Durchsatzleistung als frühere Vergleichsmodelle erzielte.
XPeng berichtet, dass der Durchsatz von TuringViT-18L 3,04-mal so hoch war wie der des Seed1.5-ViT-Modells und 2,16-mal so hoch wie der des SigLIP2-ViT-L-Modells. Das Modell wurde auf 850 Millionen Bild-Text-Paaren trainiert.
Trotz der Größe seines Trainingsdatensatzes erreichte das Modell eine durchschnittliche Punktzahl von 83,6 % über sechs Zero-Shot-Benchmarks. Diese Leistung übertrifft die von Open-Source-Basismodellen, selbst jenen, die auf bis zu 10 Milliarden Stichproben trainiert wurden.