📣 Envoyez-nous votre communiqué de presse
Site mis à jour toutes les 15 minutes
Technologie

Réduction des coûts d'inférence RAG par 6x en filtrant les données avant le LLM

L'analyse de VentureBeat propose un changement architectural pour les systèmes RAG, réduisant considérablement les appels aux LLM. Cette approche peut réduire les coûts et améliorer l'auditabilité en priorisant les résolutions déterministes et basées sur la récupération.

16 août 2026
Réduction des coûts d'inférence RAG par 6x en filtrant les données avant le LLM

VentureBeat présente une nouvelle approche pour la construction de systèmes de génération aumentada par récupération (RAG), particulièrement pour les industries réglementées, qui réduit considérablement les coûts et améliore l'auditabilité. La méthode conventionnelle consistant à acheminer tous les cas ambigus directement vers un grand modèle linguistique (LLM) est coûteuse et difficile à examiner après coup. L'"architecture en cascade" proposée vise à résoudre la plupart des cas sans intervention du LLM, réduisant les coûts d'inférence jusqu'à six fois.

L'analyse souligne qu'une architecture RAG courante, où chaque cas ambigu est envoyé à un LLM, fonctionne pour les démonstrations mais échoue dans les environnements à enjeux élevés nécessitant une responsabilité à long terme. Les problèmes clés incluent l'auditabilité, car "le modèle a décidé en se basant sur le contexte récupéré" n'est pas une explication suffisante. Les coûts augmentent également rapidement avec le volume lorsque chaque cas nécessite un appel LLM. De plus, les LLM peuvent être incohérents sur des cas simples qui devraient avoir des résultats déterministes.

L'architecture en cascade résout ce problème en utilisant le LLM comme voie d'escalade. La première étape est déterministe : résolution des règles claires et des correspondances exactes sans aucun appel de modèle. Cette étape devrait gérer la majorité des cas, souvent plus de la moitié. La deuxième étape utilise la récupération : pour les cas non résolus de manière déterministe, elle récupère les preuves pertinentes. Seuls les cas restants, le résidu véritable que les étapes un et deux n'ont pas pu résoudre, sont envoyés au LLM dans la troisième étape. Cette dernière étape traite une petite fraction des cas (environ 10-15%), ce qui réduit considérablement les coûts et améliore la cohérence.

L'article souligne également la conception des invites pour le "risque asymétrique", instruisant le LLM à traiter l'incertitude comme une raison d'escalade et à prendre explicitement en compte les conséquences des différents types d'erreurs. Cela contraste avec les invites neutres qui traitent toutes les erreurs de manière égale. Les métriques d'évaluation doivent également être adaptées, avec des mesures distinctes pour la qualité de la récupération et la classification finale, et des ensembles d'évaluation suréchantillonnant les cas difficiles qui atteignent l'étape finale du LLM.

Source originale: venturebeat.com