📣 Envoyez-nous votre communiqué de presse
Site mis à jour toutes les 15 minutes
Technologie

Le système d'IA de Writer réduit les dépenses de tokens de près de 40%

L'entreprise Writer a développé un système d'IA ('harness') qui réduit la consommation de tokens jusqu'à 38% sans modifier le modèle de base, entraînant des économies de coûts significatives.

20 juillet 2026
Le système d'IA de Writer réduit les dépenses de tokens de près de 40%

Le déploiement de l'IA en entreprise est confronté à des défis de coûts considérables, mais Writer a présenté une solution axée sur l'optimisation du 'harness' d'IA, la couche d'orchestration entourant les modèles fondamentaux. Leurs recherches démontrent qu'en affinant ce système, la consommation de tokens par tâche peut être réduite jusqu'à 38%, entraînant une baisse de 61% du coût par tâche réussie, et ce, sans compromettre la précision.

Traditionnellement, les entreprises ont lutté contre les coûts élevés de l'IA en augmentant la puissance de calcul ou en adoptant la pratique du "tokenmaxxing", c'est-à-dire en s'appuyant sur des fenêtres de contexte massives plutôt que sur une conception de système efficace. L'étude de Writer souligne que l'optimisation du 'harness' est cruciale pour l'efficacité des coûts. Cette approche évite de modifier les modèles fondamentaux, la rendant accessible aux équipes d'ingénierie.

"Les équipes utilisent un grand nombre de tokens car c'est la solution la moins chère du moment et parce que c'est littéralement ainsi que la plupart des ingénieurs travaillent aujourd'hui", a déclaré Waseem AlShikh, CTO et co-fondateur de Writer. Il a averti que la baisse des prix par token peut masquer des inefficacités sous-jacentes, car la consommation de tokens par tâche peut augmenter rapidement dans des flux de travail complexes basés sur des agents.

Les principaux leviers d'optimisation comprennent la mise en cache des invites système, la compression de l'historique des interactions, la gestion des outils, l'affinement des stratégies de récupération d'informations et la gestion des erreurs. Ces aspects sont facilement accessibles aux équipes d'ingénierie pour améliorer les performances de l'IA et réduire les dépenses. La recherche de Writer souligne que le 'harness' doit être considéré comme un artefact logiciel primaire, et non simplement comme un code de liaison connectant des API à des interfaces utilisateur.

Les chercheurs de Writer ont testé leur système optimisé sur six modèles fondamentaux. Les expériences ont révélé une réduction de 41% du coût moyen par tâche (de 0,21 $ à 0,12 $) et une baisse de 38% de la consommation de tokens (de 14,2k à 8,8k tokens) par rapport aux boucles d'agents conventionnelles, sans compromettre la qualité des résultats.

Source originale: venturebeat.com