Google kunngjør Gemini 3.1 Flash TTS med lydkodeuttrykkskontroll
Google kunngjorde denne onsdagen Gemini 3.1 Flash TTS. Tekst-til-tale-modellen gir større kontroll over vokaluttrykk og er nå tilgjengelig i forhåndsvisning for utviklere.
Den nye funksjonen integrerer Gemini API og plattformer som Google AI Studio og Vertex AI. Ela driver også voiceovers for Google Vids, Workspaces videogenereringsverktøy. Lanseringen fant sted 15. april.

Modelo oppnår høy ytelse i uavhengig rangering
Gemini 3.1 Flash TTS registrerte en ELO-score på 1211 i Artificial Analysis TTS-rangeringen. Essas merkevare plasserer den på andreplass totalt, like bak en annen konkurrent.
Modellen skiller seg ut for sin balanse mellom talekvalitet og generasjonskostnad. Ele overgår tidligere alternativer fra Google selv i naturlighet og uttrykksfullhet.
Desenvolvedores rapporterer at utgangen høres nærmere menneskelig tale i innledende testing. Latensreduksjon hjelper i applikasjoner som krever raske svar.
- Suporte er innfødt til mer enn 70 språk
- Multi-høyttaler dialog Geração
- Incorporação Automatic SynthID for AI-generert lydidentifikasjon
- Umiddelbar Disponibilidade på Google AI Studio for testing
- Integração med Vertex AI for bedriftsbruk i stor skala
Tags-lyd muliggjør presis retning av vokalytelse
Usuários kan sette inn tekstkommandoer i ledeteksten for å justere aspekter ved stemmen. Exemplos inkluderer indikasjoner som munter tone, sakte tempo eller spenning under levering.
Essas-brikker fungerer som veibeskrivelser. Elas endrer stil, aksent, tempo og følelser uten behov for komplekse tekniske parametere.
Após generasjon, innstillingene kan eksporteres som klarkode for Gemini API. Isso gjør det enkelt å distribuere til større applikasjoner og prosjekter.
Funksjonen forvandler prosessen til noe mer intuitivt. Desenvolvedores får fleksibilitet til å lage fortellinger tilpasset ulike scener eller kontekster.
Full dekning: Siste Nytt (NO)
Modellen opprettholder konsistens selv med flere høyttalere i samme lyd. Ele skiller stemmer og håndterer naturlige overganger mellom dem.
Integração med Google Vids utvider voiceover-alternativene
No Google Vids, Gemini 3.1 Flash TTS legger til 30 nye samtalestemmer. Elas fanger bedre opp nyanser av uttrykk og realisme.
Todas-alternativer kjøres nå på 24 forskjellige språk, med utvidelse til 16 ekstra språk. Utrullingen startet denne onsdagen for raske og planlagte utgivelsesdomener.
Usuários fra Workspace kan generere videoer med mer flytende og personlig fortelling. Verktøyet kombinerer lyd med AI-generert grafikk sømløst.
Tillegget forsterker Googles fokus på å gjøre innholdsskaping tilgjengelig. Profissionais og selskaper er i stand til å produsere materialer med naturlig stemme uten tradisjonelle opptak.
SynthID sikrer sporbarhet av generert innhold
Todo Audio produsert av Gemini 3.1 Flash TTS inkluderer SynthID-taggen. Ele forblir uhørlig for menneskelige lyttere, men tillater senere verifisering.
Teknologien hjelper til med å identifisere materiale skapt av AI. Ela bekjemper risikoen for feilinformasjon eller misbruk i sensitive sammenhenger som nyheter og kampanjer.
Google forsterker at vannmerking er en del av den ansvarlige strategien i utviklingen av lydverktøy.
Especialistas ser på mekanismen som et viktig fremskritt for åpenhet i generative teknologier. Ele påvirker ikke oppfattet stemmekvalitet.
Gjeldende Disponibilidade og neste trinn for utviklere
Forhåndsvisningen av modellen er åpen i Google AI Studio for rask eksperimentering. Empresas tilgangsversjon gjennom Vertex AI, med skysikkerhets- og skalerbarhetsfunksjoner.
Offisielle Documentação-veiledninger for bruk av lydetiketter og eksportparametere. Exemplos-praksis viser hvordan du bruker kommandoer ved enkle spørsmål.
Google anbefaler innledende testing på Studio AI-grensesnittet, som inkluderer en dedikert lekeplass for lyd. Lá, brukere lytter til resultatet i sanntid og avgrenser taggene.
Futuros-oppdateringer bør utvide stemme- og språkalternativene ytterligere. Selskapet detaljerte ikke en tidsplan, men signaliserte kontinuitet i å forbedre Gemini-linjen for lyd.
Fokuset er fortsatt på å balansere ytelse, kostnader og kontroll. Desenvolvedores kan nå begynne å integrere modellen i prototyper og produksjonsapplikasjoner.














