ElevenLabs stellt neue Sprachmodell-Version v4 für 90 Sprachen vor
Das KI-Stimmenunternehmen ElevenLabs hat sein neues v4-Sprachmodell vorgestellt, das die Ausdruckskontrolle verbessert und die Sprachunterstützung auf über 90 Sprachen erweitert. Das Modell ermöglicht auch eine schnellere Sprachklonung.

ElevenLabs hat am Montag die Veröffentlichung seiner Sprachmodelle v4 und v4 Turbo bekannt gegeben. Diese Modelle bieten eine verbesserte Kontrolle über den Ausdruck, eine reduzierte Latenz für Sprachassistenten und unterstützen über 90 Sprachen.
Die neue v4-Architektur ermöglicht eine bessere Kontrolle und schnellere Sprachklonung. Laut Unternehmen können Benutzer eine Stimme mit nur 10 Sekunden Audiomaterial klonen. Kreativ gesehen behandelt das Modell die Stimmidentität über längere Textsegmente besser und berücksichtigt den textlichen Kontext, um Ausdrücke anzupassen. Dies baut auf Funktionen auf, die in v3 eingeführt wurden, und erweitert die tagbasierte Steuerung für eine nuanciertere Wiedergabe.
Das Unternehmen hat die Sprachunterstützung von 70 Sprachen in der Vorgängerversion auf 90 in v4 erhöht. ElevenLabs stellte signifikante Qualitätsverbesserungen in Japanisch, brasilianischem Portugiesisch, Mandarin und Kantonesisch fest.
Das Modell ist aufgrund seiner geringeren Latenz für Sprachassistenten konzipiert, was flüssigere Konversationen ermöglicht. Es kann auch Aspekte wie Kundenfrustration und Eskalationen effektiver für eine verbesserte Problemlösung handhaben und Audio generieren, sobald das zugrunde liegende Sprachmodell eine Ausgabe liefert.