Google julkaisee Gemini-teksti puheeksi -mallit äänireplikaatiolla
Google on esitellyt uudet Gemini 3.8 Flash TTS ja Gemini 3.8 Flash-Lite TTS -mallit, jotka mahdollistavat mukautettujen puheäänien luomisen ja olemassa olevien äänien jäljentämisen.

Google on julkaissut kaksi uutta Gemini-teksti puheeksi (TTS) -mallia: Gemini 3.8 Flash TTS ja Gemini 3.8 Flash-Lite TTS. Nämä mallit on suunniteltu antamaan kehittäjille mahdollisuus luoda omia puheääniään, ohjata dialogin toimitusta ja jäljentää puhujan ääntä.
Teknologia on käytettävissä Google AI Studion kautta ja Gemini-sovellusliittymän (API) kautta. Se integroituu myös Googlen omiin tuotteisiin, kuten Gemini Notebookiin ja Google Vidsiin. Uudet mallit tukevat yli 100 kieltä ja soveltuvat monenlaisiin sovelluksiin, kuten äänikirjojen, pelien ja podcastien tuottamiseen sekä keskustelukohtausten luomiseen.
Googlen mukaan äänireplikaation käyttö vaatii ääninäytteen omistajan kirjallisen suostumuksen. Yritys korostaa, että kaikki Gemini Audio -mallien tuottama sisältö merkitään SynthID-vesileimalla, joka auttaa tunnistamaan tekoälyn luoman materiaalin.
Julkaisu laajentaa Googlen olemassa olevaa puheteknologiatarjontaa, johon kuuluvat jo Cloud Text-to-Speech ja Chirp 3 HD -äänet. Yhtiön dokumentaatiossa ei kuitenkaan ole tarkempaa tietoa siitä, miten uudet Gemini-mallit sijoittuvat suhteessa aiempiin tuotteisiin.