Writers AI-system minskar tokenförbrukningen med nästan 40%
Företaget Writer presenterar en ny metod för att minska AI:s tokenförbrukning med upp till 38% utan att ändra den underliggande AI-modellen, vilket leder till betydande kostnadsbesparingar.

Företaget Writer har presenterat ett nytt angreppssätt för att hantera kostnaderna för AI-system. Forskning visar att optimering av AI:s "harness", eller orkestreringsskikt, kan minska användningen av tokens per uppgift med upp till 38%, vilket leder till kostnadsbesparingar på upp till 61% per lyckad uppgift. Detta uppnås utan att ändra den underliggande AI-modellen.
Traditionellt har företag strävat efter att sänka AI-kostnaderna genom att öka datorkraften eller förlita sig på "tokenmaxxing", det vill säga att använda enorma kontextfönster och konsumera stora mängder tokens istället för god systemdesign. Writers forskning fokuserar på orkestreringsskiktet, som hanterar de grundläggande modellernas funktion, och visar att dess optimering är nyckeln till att förbättra kostnadseffektiviteten.
"Teamen använder mycket tokens eftersom det är den billigaste lösningen för stunden och eftersom det är så de flesta ingenjörer arbetar idag", sade Writer CTO Waseem AlShikh. Han betonade att prissänkningar per token kan dölja ineffektivitet, eftersom token-per-uppgift-förbrukningen kan öka avsevärt i komplexa agentapplikationer.
Nyckelmetoder för optimering inkluderar cachning av systemprompten, komprimering av interaktionshistoriken, verktygshantering, strategier för informationshämtning och felhantering. Dessa faktorer är lättillgängliga för ingenjörsteam att utnyttja för att förbättra AI:s prestanda och minska kostnaderna. Writers forskning understryker att harnessen måste bli ett primärt fokus i mjukvaruutvecklingen, inte längre bara en API-anslutning till ett användargränssnitt.
Writers forskare testade sitt optimerade harness mot sex olika grundläggande modeller, inklusive deras egna. Jämförelsen visade att det optimerade harnesset minskade den genomsnittliga uppgiftskostnaden med 41% (från 21 cent till 12 cent) och tokenförbrukningen med 38% (från 14,2k till 8,8k tokens) utan att kompromissa med uppgiftsutförandet.