📣 Senden Sie uns Ihre Pressemitteilung
Seite aktualisiert sich alle 15 Minuten
Technologie

Microsoft stellt Echtzeit-Spracherkennung für Text vor

Microsoft hat MAI-Transcribe-2-Streaming veröffentlicht, ein neues KI-Modell für die kontinuierliche Echtzeit-Sprach-zu-Text-Transkription in 60 Sprachen. Das Modell bietet schnelle Verarbeitung und hohe Genauigkeit.

1. Oktober 2026
Microsoft stellt Echtzeit-Spracherkennung für Text vor
Bild ist eine KI-generierte Illustration

Microsoft hat die Einführung von MAI-Transcribe-2-Streaming bekannt gegeben, seinem ersten KI-Modell für die kontinuierliche Echtzeit-Sprach-zu-Text-Transkription. Das Modell generiert Text während die Spracheingabe erfolgt und unterstützt 60 Sprachen mit automatischer Spracherkennung.

Das neue Modell wurde entwickelt, um Echtzeitanwendungen wie Kundenservice-Bots und Live-Untertitelungssysteme zu verbessern. Es kann die Absicht des Sprechers erkennen und Aktionen einleiten, bevor der Sprecher seinen Satz beendet hat, was eine unmittelbarere Erfahrung ermöglicht. Das Modell liefert erste Textsegmente schnell und verfeinert sie für Stabilität.

Laut Microsofts internen Bewertungen kann das Modell die ersten Textergebnisse etwa 320 Millisekunden nach Beginn der Spracheingabe anzeigen. In unabhängigen Tests von Artificial Analysis erreichte das Modell eine endgültige Transkriptionslatenz von 0,13 Sekunden und eine Wortfehlerrate von 2,50 %, was ihm den ersten Platz unter 28 getesteten Streaming-Sprach-zu-Text-Modellen einbrachte.

MAI-Transcribe-2-Streaming ist für Entwickler über Kanäle wie Microsoft Foundry und MAI Playground verfügbar. Es wird derzeit zu einem Einführungspreis von 0,54 US-Dollar pro Stunde angeboten. Microsoft hat zuvor das nicht-streamende Modell MAI-Transcribe-2 veröffentlicht.

Originalquelle: ithome.com