📣 Senden Sie uns Ihre Pressemitteilung
Seite aktualisiert sich alle 15 Minuten
Technologie

Google startet Gemini Text-zu-Sprache-Modelle mit Stimmreplikation

Google hat die neuen Gemini 3.8 Flash TTS- und Gemini 3.8 Flash-Lite TTS-Modelle vorgestellt, die es Entwicklern ermöglichen, eigene Stimmen zu erstellen und bestehende zu replizieren.

24. September 2026
Google startet Gemini Text-zu-Sprache-Modelle mit Stimmreplikation

Google hat zwei neue Gemini Text-zu-Sprache (TTS) Modelle eingeführt: Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS. Diese Modelle sollen es Entwicklern ermöglichen, benutzerdefinierte Stimmen zu generieren, Dialoge zu steuern und die Stimme eines Sprechers zu replizieren.

Die Technologie ist über Google AI Studio und die Gemini Application Programming Interface (API) verfügbar. Sie wird auch in Googles eigenen Produkten wie Gemini Notebook und Google Vids integriert. Die neuen Modelle unterstützen über 100 Sprachen und eignen sich für verschiedene Anwendungen, wie die Produktion von Hörbüchern, Spielen und Podcasts sowie die Erstellung von Dialogszenen.

Laut Google erfordert die Nutzung von Stimmreplikation eine schriftliche Zustimmung des Stimminhabers. Das Unternehmen betont, dass alle von den Gemini Audio-Modellen generierten Inhalte mit einer SynthID-Wasserzeichen versehen werden, um KI-generiertes Material zu identifizieren.

Die Veröffentlichung erweitert das bestehende Angebot von Google im Bereich Sprachtechnologie, das bereits Cloud Text-to-Speech und Chirp 3 HD-Stimmen umfasst. Die Dokumentation des Unternehmens spezifiziert jedoch nicht, wie die neuen Gemini-Modelle im Verhältnis zu früheren Produkten positioniert sind.

Originalquelle: techinasia.com