Évaluation des agents IA : des conversations uniques à l'analyse de cohortes
Des experts de VB Transform 2026 ont souligné un changement dans l'évaluation des agents IA, passant de la notation de traces individuelles à la comparaison de cohortes d'utilisateurs pour identifier les défauts cachés.

L'évaluation des agents d'intelligence artificielle connaît une transformation majeure. Une conversation apparemment parfaite peut masquer des problèmes de produit sous-jacents, incitant les entreprises à délaisser la notation des interactions individuelles au profit de la comparaison de groupes d'utilisateurs par rapport à une référence.
Lors de la conférence VB Transform 2026, des experts tels que Harrison Chase (PDG de LangChain), Hui Zhang (CTO de Conviva) et Emmanuel Turlay (Directeur de l'ingénierie chez CoreWeave) ont abordé cette évolution. L'industrie se tourne vers des modèles d'évaluation plus performants mais moins coûteux, déplaçant l'attention de la simple analyse de traces isolées vers une analyse comparative plus large.
« Nous voyons parfois des équipes paralysées par l'évaluation », a déclaré Harrison Chase. Il a comparé les critères d'évaluation à une spécification évolutive, similaire à un document de spécifications produit (PRD), définissant ce qu'un agent doit faire et ne pas faire. Cette approche s'oppose aux suites de tests statiques avant le lancement, qui peuvent omettre des problèmes critiques.
Emmanuel Turlay a corroboré ce point de vue, notant que viser une couverture de test de 100 % n'empêchait pas les bugs en production. « Une surveillance large et continue permet de détecter plus de défaillances réelles qu'une suite de tests exhaustive avant le lancement », a-t-il affirmé. L'approche recommandée consiste à mettre en place d'abord des contrôles en ligne étendus, à identifier les classes de défaillance, puis à développer des évaluations hors ligne ciblées.
Hui Zhang a souligné l'importance de « l'analyse contrastive », qui compare des groupes d'utilisateurs à une référence plutôt que de noter des traces individuelles. Un exemple d'achat de chaussures a illustré comment des succès isolés peuvent masquer des problèmes tels que des demandes de clarification accrues ou des achats hors conversation, visibles uniquement par des analyses de données à grande échelle. L'industrie est confrontée au défi d'équilibrer une évaluation automatisée et évolutive avec une supervision humaine nécessaire, en particulier dans les secteurs sensibles comme la finance et la santé.