Google lança Gemini capaz de raciocinar durante conversa de voz

Gemini

Gemini - Runrun2/ Shutterstock.com

O Google apresentou os sistemas Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking para processar raciocínios operacionais e executar comandos em segundo plano simultaneamente ao diálogo falado com as pessoas. A tecnologia mantém o fluxo contínuo da conversa sem pausas para processamento.

A versão Gemini 3.8 Live opera no Search Live, enquanto as ferramentas do Extended Thinking entram no aplicativo Gemini e no Google Workspace segundo as categorias de assinatura vigentes.

Profissionais de programação encontram os dois lançamentos integrados à Gemini API e ao Google AI Studio. Corporações cadastradas no Gemini Enterprise acessam o formato de testes fechados.

Assinantes das modalidades Google AI Pro e Ultra contam com o Docs Live no Google Workspace, enquanto os pacotes AI Plus, Pro e Ultra recebem o Gmail Live e o Keep Live.

Os recursos aceitam instruções por áudio para editar textos, mensagens de correio eletrônico e anotações durante a resposta da máquina. A ferramenta processa pedidos simultâneos.

 

A divisão de funções estabelece que o Gemini 3.8 Live atenda operações rápidas com foco em eficiência de gastos operacionais e volume massivo de dados, ao passo que a arquitetura Gemini 3.8 Live Extended Thinking processa comandos complexos divididos em múltiplos passos sucessivos.

Ambas as versões incorporam visão computacional em tempo real aliada ao reconhecimento automatizado de fala. O sistema transita entre 97 idiomas diferentes dentro de um único diálogo contínuo.

Capacidade de processamento simultâneo do Gemini durante diálogos

A estrutura tecnológica opera na análise de dados sem paralisar o contato verbal com os usuários. O Gemini identifica o pedido recebido e aciona rotinas operacionais nos bastidores do sistema. O diálogo segue ativo enquanto o software finaliza a operação solicitada.

O mecanismo resolve consultas informativas, gera linhas de programação e efetua marcações de compromissos.

O Gemini 3.8 Live Extended Thinking verbaliza termos breves como “deixe-me verificar isso para você” enquanto busca respostas nos servidores. A inclusão desses avisos elimina pausas silenciosas prolongadas para manter o ritmo habitual da fala humana.

Durante fluxos de trabalho longos, o sistema relata em tempo real o estágio de cada ação concluída.

A tecnologia integra sinais de voz e captura de vídeo transmitidos pelo aparelho. Ao utilizar a lente da câmera, o Gemini decodifica elementos físicos presentes no espaço imediato para orientar suas respostas faladas.

Demonstrações práticas organizadas pelo Google exibiram o suporte tático em partidas de xadrez e o treinamento interativo de novos colaboradores em ambientes corporativos.

Testes técnicos padronizados mediram o rendimento sonoro das duas ferramentas do Google. O Gemini 3.8 Live Extended Thinking liderou o Speech to Speech Quality Index ao marcar 82,6 pontos, além de registrar 97,7% no indicador Big Bench Audio.

A versão Extended obteve 68,6% no τ-Voice e 35,1% no τ-Voice-banking para serviços bancários, enquanto o Gemini 3.8 Live garantiu a segunda colocação no Speech Agent Arena sobre preferência de uso.

Todos os arquivos de voz emitidos pelo Gemini Live trazem uma marca d’água imperceptível gravada com o recurso SynthID. O método de segurança criado pelo Google viabiliza a identificação técnica de áudios gerados por algoritmos computacionais.