📣 Envoyez-nous votre communiqué de presse
Site mis à jour toutes les 15 minutes
Technologie

EvoHarness-RL de Meta AI améliore les flux de travail à long terme des agents IA

Meta AI et l'Université de l'Illinois ont développé le framework EvoHarness-RL, améliorant considérablement la capacité des agents IA à gérer des tâches complexes et de longue durée.

28 août 2026
EvoHarness-RL de Meta AI améliore les flux de travail à long terme des agents IA

Meta AI, en collaboration avec des chercheurs de l'Université de l'Illinois Urbana-Champaign, a présenté EvoHarness-RL, un nouveau framework conçu pour améliorer les performances des agents IA dans des tâches complexes et de longue durée. Cette avancée représente une étape significative vers des systèmes d'IA plus autonomes et efficaces, capables de gérer des flux de travail d'entreprise complexes sans intervention humaine constante.

Traditionnellement, les opérations des agents IA étaient régies par des règles rigides codées par l'homme, ce qui limitait leur autonomie et leur capacité d'adaptation à des situations dynamiques. EvoHarness-RL introduit une couche d'abstraction dans le système d'exécution (harness) de l'agent, apprenant au modèle quand et comment exploiter les informations acquises de son environnement. Cela résout le problème où de grands volumes de données ou des processus étendus dépassent la capacité de mémoire interne d'un agent.

Xuying Ning, co-auteur de l'étude EvoHarness-RL, a souligné que la logique codée manuellement et les structures de mémoire rigides consomment des ressources d'ingénierie considérables. "Le harnais optimal change souvent avec le modèle", a expliqué Ning. "Différents modèles peuvent nécessiter des prompts, des conceptions de mémoire ou des configurations différents. Si toute cette logique est codée manuellement, chaque mise à niveau du modèle peut entraîner un nouveau cycle d'ajustement et de débogage."

EvoHarness-RL consolide les systèmes de support de l'agent dans une interface unifiée appelée Belief, Progress, and Experience (BPE). Cela permet à l'agent d'apprendre à prendre des décisions optimales concernant la gestion de son état externe. Au lieu de suivre aveuglément des instructions codées, l'agent apprend à construire un espace de travail structuré à partir de données d'exécution désordonnées et à décider quand et comment le consulter lors de flux de travail complexes. Cela facilite également la réutilisation plus efficace des connaissances précédemment acquises et l'évitement des erreurs dans les tâches de longue durée.

Source originale: venturebeat.com