Microsoft AI lanserar taligenkänningsmodell – snabbare och billigare
Microsoft AI har presenterat den nya taligenkänningsmodellen MAI-Transcribe-2, som enligt företaget är snabbare, mer exakt och billigare än konkurrerande lösningar. Prissättningen framhäver dess kostnadseffektivitet.

Microsoft AI lanserade på torsdagen MAI-Transcribe-2, en modell för taligenkänning som företaget hävdar är snabbare, mer exakt och billigare än vad OpenAI, Google eller ElevenLabs för närvarande erbjuder. Modellen prissätts till 10 cent per ljudtimme.
Denna prissättning representerar en betydande minskning från den första versionen som lanserades för fem månader sedan för 0,36 dollar per timme. För ett företag som bearbetar 100 000 timmars samtalsdata per år kan detta innebära en kostnadsbesparing från 36 000 dollar till 10 000 dollar.
Lanseringen är en del av Microsofts strategi att bygga egna, högpresterande AI-modeller inom olika modaliteter, som sedan integreras i deras produkter. Taligenkänning är ett område där denna strategi har avancerat snabbt. MAI-Transcribe-2 stöder nu 60 språk, en ökning från 43 i den tidigare versionen. Modellen är designad för att hantera verkliga affärsmiljöer med bakgrundsljud och varierande ljudkvalitet.
Modellen inkluderar flera viktiga funktioner för företagskunder, såsom talardiskriminering, ordnivå-tidsstämplar och prioritering av nyckelord. Den identifierar även automatiskt språket och kan hantera kodväxling inom en mening. Dessa funktioner har tidigare ofta inneburit extra kostnader från specialiserade leverantörer.
Microsoft hävdar att MAI-Transcribe-2 rankas som nummer ett på FLEURS-benchmarken över 60 språk, samt som nummer två på Artificial Analysisens leaderboard för noggrannhet och latens. Enligt företaget är modellen också betydligt snabbare än konkurrerande lösningar. Den höga hastigheten bidrar till den låga prissättningen och den effektiva prestandan.