Kostnader för RAG-system kan minskas 6 gånger genom att filtrera data
VentureBeats analys föreslår en arkitektonisk förändring för RAG-system, där LLM-anrop minskas avsevärt. Detta kan minska kostnaderna och förbättra revisionsspårbarheten.

VentureBeat presenterar ett nytt tillvägagångssätt för att bygga Retrieval Augmented Generation (RAG) -system, särskilt för reglerade branscher. Den traditionella metoden att dirigera alla fall till en stor språkmodell (LLM) är kostsam och svår att granska. Den nya "kaskadarkitekturen" minskar behovet av LLM-anrop avsevärt, vilket sänker kostnaderna upp till sex gånger och förbättrar systemets förklarbarhet.
Enligt analysen dirigerar den vanligaste RAG-systemarkitekturen alla tvetydiga fall direkt till språkmodellen. Detta kan fungera i en demolmiljö, men är inte lämpligt för situationer där beslut måste stå emot granskning långt efteråt. Det största problemet är revisionsspårbarheten: "modellen beslutade baserat på hämtad kontext" är inte en tillräcklig förklaring. Dessutom ökar kostnaderna snabbt vid skalning, när ett stort antal fall kräver ett LLM-anrop. Ett tredje problem är modellens inkonsekvens för enkla fall som borde lösas deterministiskt.
Kaskadarkitekturen löser dessa problem genom att placera LLM som en eskalationsväg. Första steget är deterministiskt: tydliga regler och matchningar löses utan modell. Detta steg förväntas hantera majoriteten av fallen (ofta mer än hälften). Andra steget utnyttjar sökning: för fall som inte kunde lösas i första steget, hämtas relevant bevisning. Först i tredje steget skickas de fall som de föregående stegen inte kunde lösa till LLM. Detta steg ser bara en liten del av fallen (cirka 10-15%), vilket minskar kostnaderna avsevärt och förbättrar konsistensen.
Dessutom belyser analysen vikten av att ta hänsyn till "asymmetrisk risk" vid utformning av prompter. LLM bör instrueras att behandla osäkerhet som en eskaleringsfaktor och ta hänsyn till konsekvenserna av olika typer av fel. Detta skiljer sig från en neutral prompt som behandlar alla fel som likvärdiga. Även utvärderingsmetriker måste anpassas: kvaliteten på sökningen och den slutliga klassificeringen måste mätas separat, och utvärderingsdatasetet måste innehålla tillräckligt många svåra fall.