Évaluation des agents IA : La confiance augmente, le taux d'échec stagne selon une nouvelle étude
Une nouvelle étude révèle que la confiance des entreprises dans les évaluations automatisées des agents IA a presque triplé en juillet, tandis que le taux d'échec des agents réussissant ces évaluations est resté inchangé.

La confiance des entreprises dans les méthodes automatisées d'évaluation des agents IA a connu une augmentation significative en juillet, selon l'étude Pulse Research de VentureBeat. La part des organisations qui font entièrement confiance à ces évaluations automatisées est passée de 5 % à 13 %. Parallèlement, les plaintes concernant le manque d'alignement des évaluations avec les résultats réels ont diminué.
Malgré la confiance accrue, le taux d'échec réel des agents IA en production ne s'est pas amélioré. Près de la moitié des organisations (49 %) ont déclaré avoir déployé au cours de la dernière année un agent ou une fonctionnalité LLM qui avait réussi les évaluations internes, mais qui a ensuite causé des échecs face aux clients. Ce chiffre reste statistiquement indiscernable des 50 % du mois précédent.
L'augmentation de la confiance semble être principalement concentrée parmi les entreprises n'ayant pas d'expériences négatives antérieures. 24 % de ces organisations font entièrement confiance aux évaluations automatisées, contre seulement 4 % parmi celles ayant rencontré des problèmes. Paradoxalement, les échecs passés ne ralentissent pas l'adoption de l'autonomie ; ils semblent au contraire l'accélérer.
Du côté des fournisseurs, le marché montre des signes de consolidation. L'utilisation d'outils d'évaluation dédiés augmente, l'intégration facile devenant un critère de sélection principal par rapport au coût. L'étude repose sur les réponses de 108 entreprises comptant 100 employés ou plus.