Google annuncia Gemini 3.1 Flash TTS con controllo dell’espressione dei tag audio
Google ha annunciato questo mercoledì il TTS Gemini 3.1 Flash. Il modello di sintesi vocale offre un maggiore controllo sull’espressione vocale ed è ora disponibile in anteprima per gli sviluppatori.
La nuova funzionalità integra l’API Gemini e piattaforme come Google AI Studio e Vertex AI. Ela supporta anche le voci fuori campo per Google Vids, lo strumento di generazione video di Workspace. Il lancio è avvenuto il 15 aprile.

Modelo ottiene prestazioni elevate nella classifica indipendente
Il Gemini 3.1 Flash TTS ha registrato un punteggio ELO di 1211 nella classifica Artificial Analysis TTS. Il marchio Essa lo colloca al secondo posto assoluto, subito dietro a un altro concorrente.
Il modello si distingue per il suo equilibrio tra qualità della voce e costo di generazione. Ele supera le opzioni precedenti dello stesso Google in termini di naturalezza ed espressività.
Desenvolvedores riporta che l’output sembra più vicino al parlato umano nei test iniziali. La riduzione della latenza aiuta nelle applicazioni che richiedono risposte rapide.
- Suporte nativo in più di 70 lingue
- Dialogo con più altoparlanti Geração
- Incorporação SynthID automatico per l’identificazione audio generata dall’intelligenza artificiale
- Disponibilidade immediato su Google AI Studio per test
- Integração con Vertex AI per uso aziendale su larga scala
L’audio Tags consente una direzione precisa della performance vocale
Usuários può inserire comandi di testo all’interno del prompt per regolare gli aspetti della voce. Exemplos includono indicazioni come tono allegro, ritmo lento o tensione nella consegna.
Di più sul tema: Google aggiorna la piattaforma di intelligenza artificiale per creare app con comandi di testo
I tag Essas funzionano come indicazioni stradali. Elas cambia stile, accento, ritmo ed emozione senza la necessità di parametri tecnici complessi.
Generazione Após, le impostazioni possono essere esportate come codice pronto per l’API Gemini. Isso semplifica l’implementazione in applicazioni e progetti più grandi.
La funzionalità trasforma il processo in qualcosa di più intuitivo. Desenvolvedores acquisisce flessibilità per creare narrazioni adattate a scene o contesti diversi.
Il modello mantiene la coerenza anche con più altoparlanti nello stesso audio. Ele differenzia le voci e gestisce le transizioni naturali tra di loro.
Integração con Google Vids espande le opzioni di voiceover
No Google Vids, Gemini 3.1 Flash TTS aggiunge 30 nuove voci di conversazione. Elas cattura meglio le sfumature di espressione e realismo.
Sullo stesso tema: Il lancio di Gemini 3.1 Flash Live ottimizza le conversazioni vocali e raggiunge più di 200 paesi
Le opzioni Todas ora funzionano in 24 lingue diverse, con espansione a 16 lingue aggiuntive. Il lancio è iniziato questo mercoledì per i domini a rilascio rapido e programmato.
Usuários di Workspace può generare video con una narrazione più fluida e personalizzata. Lo strumento combina perfettamente l’audio con le immagini generate dall’intelligenza artificiale.
L’aggiunta rafforza l’attenzione di Google nel rendere accessibile la creazione di contenuti. Profissionais e le aziende sono in grado di produrre materiali dalla voce naturale senza registrazioni tradizionali.
SynthID garantisce la tracciabilità del contenuto generato
Todo L’audio prodotto da Gemini 3.1 Flash TTS include il tag SynthID. Ele rimane impercettibile agli ascoltatori umani ma consente una verifica successiva.
La tecnologia aiuta a identificare il materiale creato dall’intelligenza artificiale. Ela combatte il rischio di disinformazione o uso improprio in contesti sensibili come notizie e campagne.
Google sottolinea che il watermarking è parte della strategia responsabile nello sviluppo di strumenti audio.
Scopri di più: Google AI Studio lancia strumenti avanzati che ti consentono di creare app con istruzioni di testo
Especialistas vede il meccanismo come un importante progresso per la trasparenza nelle tecnologie generative. Ele non influisce sulla qualità della voce percepita.
Disponibilidade attuale e passaggi successivi per gli sviluppatori
L’anteprima del modello è aperta in Google AI Studio per una rapida sperimentazione. Versione di accesso Empresas tramite Vertex AI, con funzionalità di sicurezza e scalabilità cloud.
Guide ufficiali Documentação sull’utilizzo dei tag audio e sui parametri di esportazione. Le pratiche Exemplos mostrano come applicare comandi a semplici prompt.
Google consiglia di eseguire test iniziali sull’interfaccia AI Studio, che include un parco giochi dedicato per l’audio. Lá, gli utenti ascoltano il risultato in tempo reale e perfezionano i tag.
Gli aggiornamenti di Futuros dovrebbero espandere ulteriormente le opzioni vocali e linguistiche. L’azienda non ha fornito dettagli sul programma, ma ha segnalato continuità nel miglioramento della linea Gemini per l’audio.
L’attenzione rimane sul bilanciamento di prestazioni, costi e controllo. Desenvolvedores può ora iniziare a integrare il modello in prototipi e applicazioni di produzione.
















