📣 Senden Sie uns Ihre Pressemitteilung
Seite aktualisiert sich alle 15 Minuten
Technologie

Writer's KI-System senkt Token-Ausgaben um fast 40%

Das Unternehmen Writer hat ein KI-System (Harness) entwickelt, das den Token-Verbrauch um bis zu 38 % reduziert, ohne das zugrundeliegende KI-Modell zu ändern, was zu erheblichen Kosteneinsparungen führt.

20. Juli 2026
Writer's KI-System senkt Token-Ausgaben um fast 40%

Die Implementierung von Unternehmens-KI steht vor erheblichen Kostenherausforderungen, doch Writer hat eine Lösung vorgestellt, die sich auf die Optimierung des KI-Harness konzentriert, der Orchestrierungsschicht um die Basismodelle. Ihre Forschung zeigt, dass durch die Verbesserung dieses Harness der Token-Verbrauch pro Aufgabe um bis zu 38 % reduziert werden kann, was zu einer Senkung der Kosten pro erfolgreicher Aufgabe um 61 % führt, ohne die Genauigkeit zu beeinträchtigen.

Traditionell haben Unternehmen hohe KI-Kosten durch erhöhte Rechenleistung oder die Praxis des "Tokenmaxxing" bekämpft, bei der auf riesige Kontextfenster gesetzt wird, anstatt auf effizientes Systemdesign. Writers Studie hebt hervor, dass die Optimierung des Harness selbst entscheidend für die Kosteneffizienz ist. Dieser Ansatz erfordert keine Änderung der Kern-KI-Modelle und ist somit für Ingenieurteams zugänglich.

"Teams nutzen 'Tokenmaxxing', weil es die billigste Sofortlösung ist und weil die meisten Ingenieure heute so arbeiten", erklärte Waseem AlShikh, CTO und Mitgründer von Writer. Er warnte, dass sinkende Preise pro Token zugrunde liegende Ineffizienzen maskieren können, da der Token-pro-Aufgabe-Verbrauch in komplexen agentenbasierten Arbeitsabläufen schnell ansteigen kann.

Wesentliche Optimierungshebel sind das Caching von System-Prompts, die Komprimierung der Interaktionshistorie, die Verwaltung von Werkzeugen, die Verfeinerung von Abrufstrategien und das Fehlermanagement. Diese Aspekte sind für Ingenieurteams leicht verfügbar, um die KI-Leistung zu verbessern und die Ausgaben zu senken. Writers Forschung betont, dass der Harness als primäres Softwareartefakt behandelt werden muss und nicht nur als Klebstoffcode, der APIs mit Benutzeroberflächen verbindet.

Writers Forscher testeten ihr optimiertes Harness gegen sechs Basismodelle. Die Experimente zeigten eine Reduzierung der durchschnittlichen Kosten pro Aufgabe um 41 % (von 0,21 USD auf 0,12 USD) und einen Rückgang des Token-Verbrauchs um 38 % (von 14,2k auf 8,8k Tokens) im Vergleich zu herkömmlichen Agentenschleifen, ohne die Qualität der Ausgaben zu beeinträchtigen.

Originalquelle: venturebeat.com