📣 Envoyez-nous votre communiqué de presse
Site mis à jour toutes les 15 minutes
Technologie

AWS SageMaker accélère la mise à l'échelle des grands modèles de langage

Amazon Web Services a introduit le Fast Model Loader pour Amazon SageMaker Inference. Cette nouvelle capacité réduit les temps de chargement des modèles et accélère la mise à l'échelle automatique des grands modèles de langage (LLM).

2 octobre 2026
AWS SageMaker accélère la mise à l'échelle des grands modèles de langage

Amazon Web Services (AWS) a dévoilé le Fast Model Loader pour son service Amazon SageMaker Inference. Cette nouvelle fonctionnalité vise à réduire considérablement le temps de chargement et à accélérer la mise à l'échelle des grands modèles de langage (LLM) pour l'inférence.

Avec des LLM atteignant des centaines de milliards de paramètres et nécessitant une mémoire substantielle, le processus de chargement de ces modèles sur les accélérateurs est devenu un goulot d'étranglement. Ce défi a entravé le déploiement efficace et la mise à l'échelle rapide des LLM pour gérer des modèles de trafic fluctuants.

Le Fast Model Loader fonctionnerait en diffusant les poids du modèle directement depuis Amazon Simple Storage Service (S3) vers l'accélérateur, réduisant ainsi les temps de chargement. AWS affirme que cela peut entraîner une réduction de la latence allant jusqu'à 19 % lors de la mise à l'échelle d'une nouvelle copie de modèle sur une nouvelle instance pour l'inférence.

Cette nouvelle capacité fait partie de l'offre SageMaker Large Model Inference (LMI), conçue pour aider les clients à déployer plus rapidement des LLM sur SageMaker Inference. AWS a présenté cette technologie lors de son événement AWS re:Invent 2024.

Source originale: aws.amazon.com