ElevenLabs lance son nouveau modèle vocal v4 pour 90 langues
La société de voix IA ElevenLabs a lancé son nouveau modèle vocal v4, améliorant le contrôle de l'expression et étendant la prise en charge linguistique à plus de 90 langues. Le modèle permet également un clonage vocal plus rapide.

ElevenLabs a annoncé lundi la sortie de ses modèles vocaux v4 et v4 Turbo, qui offrent un contrôle d'expression amélioré, une latence réduite pour les agents vocaux et prennent en charge plus de 90 langues.
La nouvelle architecture v4 permet un meilleur contrôle et un clonage vocal plus rapide, l'entreprise affirmant que les utilisateurs peuvent cloner une voix à partir de seulement 10 secondes d'audio. Sur le plan créatif, le modèle gère mieux l'identité vocale sur de longs segments de texte et prend en compte le contexte textuel pour ajuster les expressions. Cela s'appuie sur les fonctionnalités introduites dans la v3, en élargissant le contrôle basé sur des balises pour une restitution plus nuancée.
L'entreprise a augmenté la prise en charge linguistique de 70 langues dans la version précédente à 90 dans la v4. ElevenLabs a noté des améliorations significatives de la qualité en japonais, portugais brésilien, mandarin et cantonais.
Le modèle est conçu pour les agents vocaux en raison de sa faible latence, permettant des conversations plus fluides. Il peut également gérer plus efficacement des aspects tels que la frustration du client et les escalades pour une meilleure résolution des problèmes, générant de l'audio dès que le modèle linguistique sous-jacent fournit une sortie.