Des chercheurs de ByteDance identifient la cause des récupérations incohérentes de long contexte dans les modèles DeepSeek
Des chercheurs de ByteDance ont identifié un mécanisme à l'origine de récupérations incohérentes de long contexte dans les modèles DeepSeek. Leur étude a révélé que la compression du cache KV par segments rend la précision de récupération sensible à la position de l'information dans une fenêtre de compression, entraînant des différences de précision allant jusqu'à 40 points de pourcentage.

Des chercheurs de l'équipe Seed de ByteDance ont identifié un mécanisme responsable de la récupération incohérente d'informations dans de longs contextes au sein des modèles DeepSeek. Leur étude a révélé que la compression du cache KV par segments rend la précision de récupération sensible à la position de l'information au sein d'une fenêtre de compression. Cette sensibilité peut entraîner des variations de précision allant jusqu'à 40 points de pourcentage entre différentes positions.
La technique de compression vise à réduire les coûts de mémoire et d'attention en regroupant des tokens consécutifs en moins d'entrées de cache. Cependant, l'équipe de ByteDance a découvert que la même information peut être facilement récupérable à partir d'un emplacement et difficile d'accès à partir d'un autre, un phénomène qu'ils ont appelé « sensibilité de phase ».
Ce comportement a été reproduit dans des modèles entraînés à partir de zéro, où les chercheurs ont observé que différentes composantes du mécanisme d'attention se spécialisent dans la récupération d'informations à partir de positions spécifiques. Ces conclusions aident à expliquer comment de bons résultats moyens aux benchmarks peuvent masquer des faiblesses récurrentes dans la capacité des modèles à récupérer des détails spécifiques à partir de longs contextes.
Cette recherche offre des perspectives cruciales sur les limites des grands modèles linguistiques actuels dans le traitement de données textuelles étendues et pourrait éclairer les futures avancées dans le développement de capacités plus fiables de compréhension de longs contextes.