Google veröffentlicht Gemini 3.5 Transcribe für KI-gestützte Sprache-zu-Text-Umwandlung
Google hat Gemini 3.5 Transcribe, ein neues KI-Modell zur Verbesserung der Genauigkeit und Geschwindigkeit von Sprache-zu-Text-Umwandlung, eingeführt. Das Modell zielt darauf ab, sauberere, bearbeitete Transkripte durch das Entfernen von Füllwörtern und Korrekturen zu erstellen.

Google hat Gemini 3.5 Transcribe vorgestellt, ein Modell der künstlichen Intelligenz, das die Sprache-zu-Text-Umwandlung verbessern soll, indem es Füllwörter wie „äh“ und Selbstkorrekturen automatisch herausfiltert. Dieses neue Modell aus der Gemini 3.5-Familie soll aus gesprochener Sprache polierte Textausgaben erzeugen.
Das Unternehmen gibt an, dass Gemini 3.5 Transcribe deutliche Verbesserungen in Bezug auf Geschwindigkeit und Genauigkeit gegenüber seinem Vorgänger Chirp 3 bietet. Google berichtet von einer 70-prozentigen Geschwindigkeitssteigerung von der Spracheingabe bis zum endgültigen transkribierten Text. Darüber hinaus wurde die Fehlerrate bei Live-Sprache auf 5,5 Prozent reduziert, was eine Verbesserung gegenüber der von Chirp 3 gemessenen Rate von 7,32 Prozent darstellt.
Diese Technologie ist bereits in das Google-Ökosystem integriert und treibt die „Rambler“-Funktion von Gboard auf Pixel-Geräten an. Die breitere Einführung zielt darauf ab, die Spracheingabe für Benutzer über verschiedene Google-Anwendungen und -Dienste hinweg effizienter und zuverlässiger zu gestalten.
Googles fortlaufende Entwicklung im Bereich der KI-Spracherkennung signalisiert fortgesetzte Bemühungen, die Benutzerinteraktion mit seinen Produkten zu verfeinern, mit dem Ziel nahtlosere und weniger fehleranfällige sprachbasierte Erlebnisse zu schaffen.