AWS SageMaker beschleunigt Skalierung großer Sprachmodelle
Amazon Web Services hat den Fast Model Loader für Amazon SageMaker Inference eingeführt. Die neue Funktion reduziert die Ladezeiten von Modellen und beschleunigt das Autoskalieren für große Sprachmodelle (LLMs).

Amazon Web Services (AWS) hat den Fast Model Loader für seinen Dienst Amazon SageMaker Inference eingeführt. Die neue Funktion soll die Ladezeit und Skalierbarkeit von großen Sprachmodellen (LLMs) für die Inferenz erheblich verbessern.
Mit Modellen, die Hunderte von Milliarden Parametern umfassen und erhebliche Speicherkapazitäten erfordern, ist der Ladevorgang auf Beschleuniger zu einem Engpass geworden. Dies erschwert die effiziente Bereitstellung und schnelle Skalierung von LLMs zur Bewältigung schwankender Verkehrsmuster.
Der Fast Model Loader lädt laut AWS Modellgewichte direkt aus dem Amazon Simple Storage Service (S3) auf den Beschleuniger. Dies kann zu einer Latenzreduzierung von bis zu 19 % führen, wenn eine neue Modellkopie für die Inferenz auf eine neue Instanz skaliert wird.
Diese neue Funktion ist Teil des Angebots SageMaker Large Model Inference (LMI), das Kunden helfen soll, LLMs schneller auf SageMaker Inference bereitzustellen. AWS präsentierte die Technologie auf seiner Veranstaltung AWS re:Invent 2024.