Meta lanserar Muse Voice Transcribe för tal-till-text-omvandling
Meta introducerar Muse Voice Transcribe, en ny modell för tal-till-text som hanterar över 20 talare i realtid. Tjänsten prissätts till 0,18 dollar per timme och erbjuder avancerade funktioner för företag.

Meta har lanserat Muse Voice Transcribe, en ny modell som konkurrerar på marknaden för realtids tal-till-text. Modellen kombinerar strömmande transkription, taligenkänning och talardiarisering (identifiering av vem som talar) för över 20 personer. Priset är satt till 0,18 dollar per timme för bearbetat ljud.
Utvecklad av Meta Superintelligence Labs, är Muse utformad för att bearbeta tal i realtid, istället för att vänta tills en inspelning är färdig. Meta uppger att Muse stöder långa ljudfiler som överstiger en timme, sömlös flerspråkig kodväxling, språk- och nyckelordsförspänning, samt talardiarisering utan behov av separat efterbearbetning. Modellen har tränats på över 70 språk, varav 25 har validerats noggrant för den initiala releasen.
Siffran på över 20 talare är betydande, men inte ett absolut rekord. Konkurrenter som Speechmatics erbjuder identifiering för upp till 100 talare, och Amazon Transcribe klarar upp till 30. Muse positionerar sig dock högt på marknaden genom att erbjuda en kombination av kapacitet för många talare, låg latens, flerspråkighet och aggressiv prissättning i en enda modell.
Denna kombination kan vara särskilt värdefull för företag som utvecklar system för möten, samtalsanalys eller AI-assistenter. Talardiarisering blir allt viktigare för att korrekt attribuera tal till rätt person, vilket är avgörande för tillförlitlig dokumentation och analys.
Prissättningen på 0,18 dollar per timme gör Muse till ett konkurrenskraftigt alternativ. Meta anger att detta pris gäller för faktiskt bearbetat ljud och är detsamma för både strömmande och icke-strömmande transkription, med alternativ för noll datalagring till samma pris.