AWS SageMaker accélère la mise à l'échelle des grands modèles de langage
Amazon Web Services a introduit le Fast Model Loader pour Amazon SageMaker Inference. Cette nouvelle capacité réduit les temps de chargement des modèles et accélère la mise à l'échelle automatique des grands modèles de langage (LLM).

Amazon Web Services (AWS) a dévoilé le Fast Model Loader pour son service Amazon SageMaker Inference. Cette nouvelle fonctionnalité vise à réduire considérablement le temps de chargement et à accélérer la mise à l'échelle des grands modèles de langage (LLM) pour l'inférence.
Avec des LLM atteignant des centaines de milliards de paramètres et nécessitant une mémoire substantielle, le processus de chargement de ces modèles sur les accélérateurs est devenu un goulot d'étranglement. Ce défi a entravé le déploiement efficace et la mise à l'échelle rapide des LLM pour gérer des modèles de trafic fluctuants.
Le Fast Model Loader fonctionnerait en diffusant les poids du modèle directement depuis Amazon Simple Storage Service (S3) vers l'accélérateur, réduisant ainsi les temps de chargement. AWS affirme que cela peut entraîner une réduction de la latence allant jusqu'à 19 % lors de la mise à l'échelle d'une nouvelle copie de modèle sur une nouvelle instance pour l'inférence.
Cette nouvelle capacité fait partie de l'offre SageMaker Large Model Inference (LMI), conçue pour aider les clients à déployer plus rapidement des LLM sur SageMaker Inference. AWS a présenté cette technologie lors de son événement AWS re:Invent 2024.