📣 Skicka ert pressmeddelande till oss
Webbplatsen uppdateras var 15:e minut
Teknologi

AWS SageMaker snabbar upp skalning av stora språkmodeller

Amazon Web Services (AWS) har introducerat Fast Model Loader i Amazon SageMaker Inference. Den nya funktionen minskar avsevärt laddningstiden för stora språkmodeller och accelererar deras skalning.

2 oktober 2026
AWS SageMaker snabbar upp skalning av stora språkmodeller

Amazon Web Services (AWS) har lanserat en ny funktion kallad Fast Model Loader för sin Amazon SageMaker Inference-tjänst. Teknologin uppges avsevärt minska laddningstiden för stora språkmodeller (LLM) och accelerera deras skalning vid inferens.

Med modeller som växer till hundratals miljarder parametrar och kräver hundratals gigabyte minne har laddning av dessa modeller till acceleratorer blivit en flaskhals. Detta har försvårat effektiv driftsättning och snabb skalning av LLM-modeller för varierande trafikmönster.

Fast Model Loader sägs minska modellens laddningstid genom att strömma modellvikter direkt från Amazon Simple Storage Service (S3) till acceleratorn. AWS rapporterar en minskning av latensen med upp till 19 procent vid skalning av en ny modellkopia på en ny instans för inferens.

Den nya funktionen är en del av SageMaker Large Model Inference (LMI) -paketet, som syftar till att hjälpa kunder att snabbare driftsätta LLM-modeller i SageMaker Inference. AWS presenterade teknologin vid sitt evenemang AWS re:Invent 2024.

Ursprunglig källa: aws.amazon.com