Hur datorer lär sig tala som människor
En datateknikingenjör förklarar hur text-till-tal-tekniken har utvecklats för att låta mer naturlig och likna mänskliga röster genom artificiell intelligens.

Datateknikingenjören Tam Nguyen reder ut hur digitala assistenter som Siri och Alexa har lärt sig låta mänskliga. Utvecklingen inom text-till-tal-teknik, som simulerar hur människor producerar tal, har möjliggjort allt mer naturtroget digitalt tal.
Tekniken bygger på att forma ljudvågor. Datorprogram omvandlar text till fonem, de minsta ljudenheterna i tal. Dessa kombineras sedan till ord och meningar. Tidiga försök att få maskiner att tala gjordes redan på 1700-talet med mekaniska anordningar, men ljuden var grova. De första elektroniska talsynteserna kom på 1930-talet, men den tal som datorer byggde ihop lät stel och robotaktig.
Moderna system använder maskininlärning, en form av artificiell intelligens. Program tränas genom att analysera tusentals timmar av mänskligt tal, inklusive variationer i andning, känslor och tonhöjd. Detta gör det möjligt att efterlikna talets nyanser och mänskliga egenskaper.
Avancerad AI kan till och med lära sig att imitera en individs unika talmönster från ett kort ljudprov. Även om text-till-tal-tekniken erbjuder betydande fördelar, som hjälp för synskadade eller personer som inte kan tala, öppnar den också för missbruk, såsom realistiska röstförfalskningar (audio deepfakes). Forskare arbetar med att utveckla metoder för att identifiera dessa falska röster.