Microsoft lance un modèle de reconnaissance vocale en temps réel
Microsoft a dévoilé MAI-Transcribe-2-Streaming, son premier modèle IA de transcription vocale continue en temps réel dans 60 langues. Le modèle offre une exécution rapide et une haute précision.

Microsoft a annoncé le lancement de MAI-Transcribe-2-Streaming, son premier modèle d'intelligence artificielle dédié à la transcription vocale continue en temps réel. Ce modèle génère du texte au fur et à mesure que la parole est émise, prenant en charge 60 langues avec détection automatique de la langue.
Le nouveau modèle vise à améliorer les applications temps réel, telles que les agents conversationnels du service client et les systèmes de sous-titrage en direct. Il peut anticiper l'intention de l'utilisateur et lancer des actions avant même que la phrase ne soit terminée, offrant ainsi une expérience plus réactive. Le modèle produit rapidement des segments de texte initiaux et les affine pour une meilleure stabilité.
Selon les évaluations internes de Microsoft, le modèle peut afficher les premiers résultats textuels environ 320 millisecondes après le début de la parole. Dans des tests indépendants menés par Artificial Analysis, le modèle a atteint une latence de transcription finale de 0,13 seconde et un taux d'erreur de mots de 2,50 %, le plaçant en tête des 28 modèles de transcription vocale en streaming testés.
MAI-Transcribe-2-Streaming est accessible aux développeurs via des plateformes telles que Microsoft Foundry et MAI Playground. Il est actuellement proposé à un tarif promotionnel de 0,54 $ par heure. Microsoft avait précédemment lancé le modèle non-streaming MAI-Transcribe-2.