Performance réelle de l'IA : Les tests mis en cause
Les modèles d'IA excellent dans les tests mais peinent souvent dans le monde réel. Les entreprises doivent évaluer l'IA selon leurs propres besoins.

Les systèmes d'intelligence artificielle démontrent une compétence croissante dans les tests standardisés, mais leur performance dans des scénarios réels et imprévisibles suscite des préoccupations. Bien que l'IA avancée puisse résoudre des problèmes mathématiques complexes, les mêmes systèmes échouent parfois à des tâches simples comme lire une horloge analogique. Cette disparité est critique car l'IA est souvent commercialisée comme universellement capable, malgré des performances variables selon les domaines.
Le secteur technologique a observé ce schéma. Par exemple, les robots Optimus de Tesla auraient nécessité une intervention humaine pour certaines fonctions après leurs démonstrations, et les lunettes d'IA de Meta auraient connu des défaillances lors de présentations en direct. Ces incidents soulignent le fossé entre la performance de l'IA dans des environnements contrôlés et son comportement dans le monde réel. Ce défi s'étend aux entreprises où de nombreux investissements en IA ne génèrent pas de retours mesurables.
La tendance du « benchmaxxing », ou l'optimisation de l'IA pour les tests de performance, se généralise. Bien que les benchmarks fournissent un langage commun et facilitent les comparaisons, ils peuvent amener les organisations à privilégier le passage des tests plutôt que l'amélioration réelle des capacités. Des études indiquent que les benchmarks eux-mêmes peuvent être manipulés et que certains tests largement utilisés atteignent un point de saturation, ne parvenant plus à différencier efficacement les meilleurs modèles.
Les pratiques de démonstration peuvent également induire en erreur. Les démonstrations sont conçues pour mettre en valeur les points forts, omettant souvent les conditions difficiles rencontrées en production. Il est conseillé aux acheteurs d'exiger des fournisseurs des informations détaillées, y compris sur les performances pour des cas d'utilisation spécifiques et des segments de clientèle variés. L'évaluation de la performance de l'IA après le déploiement et une mesure continue sont essentielles pour comprendre ses véritables capacités.
Au-delà des tests et démonstrations traditionnels, la représentation des données est un facteur crucial. Les systèmes d'IA entraînés et testés sur des ensembles de données restreints peuvent bien performer pour certains groupes d'utilisateurs, mais mal pour d'autres, tels que ceux ayant des accents ou des styles de parole différents. Les organisations doivent s'assurer que les systèmes d'IA sont globalement validés pour tous les utilisateurs. La question clé n'est plus de savoir si l'IA peut réussir un test, mais si le test reflète fidèlement la réalité.