XPeng publie TuringViT pour la conduite intelligente et la robotique
Le constructeur automobile XPeng a publié TuringViT, un encodeur de vision pour la conduite intelligente, les systèmes de cockpit et son programme de robot humanoïde IRON.

Le constructeur automobile XPeng a publié TuringViT, un encodeur de vision conçu pour les applications de conduite intelligente, les systèmes de cockpit intelligents et le programme de robot humanoïde IRON de l'entreprise.
TuringViT est destiné à être utilisé dans les modèles vision-langage et vision-langage-action. XPeng propose le modèle en deux versions : TuringViT-18L et TuringViT-24L. L'entreprise a indiqué que TuringViT-18L, fonctionnant à une résolution de 1536x1536, a atteint un débit considérablement plus élevé que les modèles de référence précédents.
XPeng rapporte que le débit de TuringViT-18L était 3,04 fois supérieur à celui du modèle Seed1.5-ViT et 2,16 fois supérieur à celui du modèle SigLIP2-ViT-L. Le modèle a été entraîné sur 850 millions de paires image-texte.
Malgré la taille de son jeu de données d'entraînement, le modèle a obtenu un score moyen de 83,6 % sur six benchmarks en zéro-shot. Ces performances surpassent celles des modèles de référence open source, même ceux entraînés sur jusqu'à 10 milliards d'échantillons.