📣 Skicka ert pressmeddelande till oss
Webbplatsen uppdateras var 15:e minut
Teknologi

ByteDance-forskare identifierade orsaken till inkonsekvent långkontext-hämtning i DeepSeek-modeller

ByteDance-forskare har identifierat en mekanism bakom inkonsekvent långkontext-hämtning i DeepSeek-modeller. Deras studie visade att chunked KV-cache-komprimering gör hämtningsnoggrannheten känslig för var information faller inom ett komprimeringsfönster, vilket ger skillnader på upp till 40 procentenheter.

9 oktober 2026
ByteDance-forskare identifierade orsaken till inkonsekvent långkontext-hämtning i DeepSeek-modeller

Forskare från ByteDance Seed-team har identifierat en mekanism som orsakar inkonsekvent hämtning av information från långa kontexter i DeepSeek-modeller. Deras studie fann att komprimering av KV-cache i segment gör att hämtningsnoggrannheten blir känslig för var informationen befinner sig inom ett komprimeringsfönster. Detta leder till precisionstill skillnader på upp till 40 procentenheter beroende på position.

Tekniken syftar till att minska kostnaderna för minnesanvändning och uppmärksamhet genom att komprimera grupper av på varandra följande tokens till färre cacheposter. Forskarna upptäckte dock att samma information kan vara lätt att hämta från en position och svår från en annan, ett mönster de kallar "fas-känslighet".

Forskarna återskapade beteendet i modeller som tränats från grunden och fann att olika uppmärksamhetskomponenter specialiserar sig på att hämta information från olika positioner. Resultaten förklarar hur starka genomsnittliga benchmarkresultat kan dölja återkommande svagheter i hämtningsprocessen.

Denna forskning bidrar till en djupare förståelse för hur stora språkmodeller hanterar omfattande datamängder och kan leda till utvecklingen av mer robusta och pålitliga AI-system för hantering av långa textsekvenser.

Ursprunglig källa: technode.com