Google julkistaa Gemini 3.5 Transcriben tekoälypohjaiseen puheentunnistukseen
Google on julkaissut Gemini 3.5 Transcribe -tekoälymallin puheentunnistuksen parantamiseksi. Malli pyrkii tuottamaan selkeämpiä, muokattuja litterointeja poistamalla täytesanat ja korjaukset.

Google on esitellyt Gemini 3.5 Transcribe -tekoälymallin, jonka tarkoituksena on parantaa puheentunnistusta automaattisesti muokkaamalla pois "öö"-tyyppisiä täytesanoja ja korjauksia. Uusi malli, joka kuuluu Gemini 3.5 -perheeseen, on suunniteltu tuottamaan viimeisteltyjä tekstimuotoisia tulosteita puhutusta kielestä.
Yhtiön mukaan Gemini 3.5 Transcribe tarjoaa merkittäviä parannuksia sekä nopeudessa että tarkkuudessa edeltäjäänsä Chirp 3:een verrattuna. Google raportoi 70 prosentin nopeuslisäyksen puhesignaalista lopulliseen litteroituun tekstiin. Lisäksi reaaliaikaisen puheen virhetaso on laskenut 5,5 prosenttiin, mikä on parannus Chirp 3:n mitattuun 7,32 prosentin virhetasoon.
Tämä teknologia on jo integroitu Googlen ekosysteemiin, ja se toimii Pixel-laitteiden Gboard "Rambler" -ominaisuudessa. Laajempi käyttöönotto pyrkii tekemään puhesyötteestä tehokkaampaa ja luotettavampaa käyttäjille eri Google-sovelluksissa ja -palveluissa.
Googlen jatkuva kehitys tekoälypohjaisessa puheentunnistuksessa viittaa jatkuvaan pyrkimykseen hienosäätää käyttäjien vuorovaikutusta tuotteidensa kanssa, tavoitteena saumattomammat ja virheettömämmät puhepohjaiset kokemukset.