ByteDance-Forscher identifizieren Ursache für inkonsistente Langkontext-Abrufe in DeepSeek-Modellen
Forscher von ByteDance haben einen Mechanismus identifiziert, der für inkonsistente Langkontext-Abrufe in DeepSeek-Modellen verantwortlich ist. Ihre Studie ergab, dass die segmentierte KV-Cache-Kompression die Abrufgenauigkeit empfindlich auf die Position von Informationen innerhalb eines Kompressionsfensters macht, was zu Genauigkeitsunterschieden von bis zu 40 Prozentpunkten führt.

Forscher des ByteDance Seed-Teams haben einen Mechanismus identifiziert, der für inkonsistente Ergebnisse beim Abruf von Langkontext-Informationen in DeepSeek-Modellen verantwortlich ist. Ihre Studie ergab, dass die segmentierte KV-Cache-Kompression die Genauigkeit des Informationsabrufs empfindlich gegenüber der Position von Informationen innerhalb eines Kompressionsfensters macht. Dies kann zu Genauigkeitsunterschieden von bis zu 40 Prozentpunkten führen.
Die Kompressionstechnik zielt darauf ab, Speicher- und Aufmerksamkeitskosten zu senken, indem Gruppen aufeinanderfolgender Tokens in weniger Cache-Einträge komprimiert werden. Die Forscher stellten jedoch fest, dass dieselbe Information von einer Position leicht abrufbar und von einer anderen Position schwer abrufbar sein kann – ein Phänomen, das sie als „Phasenempfindlichkeit“ bezeichnen.
Dieses Verhalten wurde in Modellen reproduziert, die von Grund auf neu trainiert wurden. Die Forscher beobachteten, dass sich verschiedene Komponenten des Aufmerksamkeitsmechanismus auf den Abruf von Informationen aus bestimmten Positionen spezialisieren. Diese Ergebnisse erklären, wie starke durchschnittliche Benchmark-Ergebnisse wiederkehrende Schwächen beim Abruf von Informationen aus langen Kontexten verbergen können.
Die Forschung liefert wichtige Einblicke in die Einschränkungen aktueller großer Sprachmodelle bei der Verarbeitung umfangreicher Textdaten und könnte zukünftige Fortschritte bei der Entwicklung zuverlässigerer Fähigkeiten zum Verständnis langer Kontexte informieren.