ChatGPT recebe melhorias em agosto: GPT-5.6 traz robustez e foco na segurança para todos
A OpenAI está lançando, em agosto, uma série de atualizações para o ChatGPT, introduzindo modelos mais potentes e ampliando o acesso a recursos avançados. Usuários das versões Free e Go passarão a utilizar um novo modelo padrão para suas interações diárias. Já quem assina os planos Plus e Pro terá acesso a uma versão aprimorada do GPT-5.6 Sol, que inclui um controle deslizante para ajustar o nível de esforço do ChatGPT na geração de respostas. Esses novos modelos substituem o GPT-5.5 Instant, marcando um avanço significativo na experiência do usuário.
A empresa reforçou que as versões de agosto do GPT-5.6 Sol e do GPT-5.6 Luna são consideradas de alta capacidade em termos de segurança cibernética e reconhecimento biológico e químico, conforme sua Estrutura de Preparação. Nenhuma das versões, porém, alcançou o limiar de alta capacidade em autoaperfeiçoamento de IA. A avaliação de segurança dos modelos é realizada em suas configurações mais básicas, como o modo instantâneo, para capturar o desempenho na maioria dos usos, enquanto as capacidades são testadas em seu esforço máximo de raciocínio.
Pela primeira vez, a OpenAI incluiu avaliações específicas para usuários com menos de 18 anos. Essas análises foram desenvolvidas para medir o comportamento dos modelos em relação a padrões de segurança criados especialmente para adolescentes, demonstrando um esforço contínuo para tornar o ChatGPT mais seguro para essa faixa etária.
Detalhes sobre os modelos e o processo de treinamento
Os modelos GPT-5.6 Sol e GPT-5.6 Luna, como outros desenvolvidos pela OpenAI, foram treinados em vastos conjuntos de dados. Isso inclui informações publicamente disponíveis na internet, dados obtidos por meio de parcerias com terceiros e informações fornecidas ou geradas por usuários, treinadores e pesquisadores. A empresa utiliza um rigoroso processo de filtragem de dados para garantir a qualidade e reduzir possíveis riscos. Classificadores de segurança são empregados para prevenir ou diminuir a presença de conteúdo sensível ou prejudicial, como material sexual explícito envolvendo menores.
A OpenAI aponta que os valores de comparação de modelos lançados anteriormente podem ter pequenas variações em relação aos valores publicados inicialmente, pois se referem às versões mais recentes desses modelos. A empresa reitera que o uso do GPT-5.6 deve estar em conformidade com suas Políticas de Uso, Termos de Serviço e Termos de Uso, que garantem a utilização responsável da tecnologia de inteligência artificial.
Avaliações de segurança sobre conteúdo proibido
Para garantir a conformidade com suas políticas, a OpenAI realiza avaliações comparativas em diversas categorias de conteúdo proibido. A empresa usa os Benchmarks de Produção, um conjunto de análises que inclui conversas desafiadoras extraídas de dados de uso real. Esses benchmarks são projetados para serem difíceis e ajudam a mensurar o progresso, especialmente onde as avaliações padrão já apresentavam níveis elevados de desempenho. As taxas de erro observadas nessas avaliações não refletem o tráfego médio de produção, mas sim um teste rigoroso do comportamento do modelo sem as salvaguardas em nível de sistema.
Mais sobre o assunto: Apple estuda designs radicais para o Watch com modelos redondos e rastreadores sem tela
Avaliando o GPT-5.6 Sol em comparação com o GPT-5.5 Instant June Update, os resultados mostram um desempenho similar em todas as categorias proibidas, exceto para conteúdo violento e sexual, onde não houve diferença estatisticamente significativa. Para o GPT-5.6 Luna, o desempenho também foi comparável, com exceção de conteúdo violento. Em relação ao conteúdo sexual proibido, a OpenAI implementou uma mitigação adicional em nível de sistema, visando evitar que material erótico explícito chegue aos usuários em produção. Para menores de 18 anos, proteções adicionais apropriadas para a idade foram aplicadas, restringindo ainda mais o conteúdo sexual e a exposição a material violento explícito.

Proteções e limites para usuários menores de 18 anos
Os sistemas de inteligência artificial podem oferecer grandes benefícios para adolescentes, auxiliando no aprendizado, na criação, na resolução de problemas e no desenvolvimento de novas habilidades. A OpenAI projeta seus sistemas com cuidado para maximizar esses benefícios, enquanto mitiga possíveis danos que possam afetar desproporcionalmente ou de forma mais severa usuários menores de 18 anos. Os princípios e requisitos que guiam o comportamento dos modelos são definidos nas Especificações de Modelo.
Para adolescentes, são implementadas disposições específicas para cada faixa etária nas políticas de segurança, estabelecendo limites mais restritivos do que os aplicados a adultos em áreas como conteúdo sexual, dependência emocional, transtornos alimentares e acesso a bens/serviços com restrição de idade. O modelo é treinado para evitar encenações românticas, incentivo a desafios com restrição de idade ou posicionar-se como substituto de relacionamentos reais. Além disso, quando identifica sinais de que um adolescente pode precisar de apoio, o sistema é projetado para reforçar limites saudáveis e incentivar a conexão com adultos de confiança, como pais ou professores. As medidas de segurança em nível de sistema adicionam uma camada extra, limitando o acesso a conteúdo sensível, incentivando pausas prolongadas no uso e fornecendo ferramentas de gerenciamento para pais. As avaliações específicas para menores de 18 anos demonstram um desempenho sólido do GPT-5.6 Sol e Luna, incluindo melhorias em relação a produtos/serviços com restrição de idade e conteúdo sexual.
Saiba mais: OpenAI e Google limitam acessos gratuitos a Sora, Gemini e Nano Banana Pro
Capacidades de visão do modelo e avaliações
A OpenAI também realiza avaliações de entrada de imagem para medir a saída “not_unsafe” do modelo, considerando combinações de texto e imagem não permitidas. Os resultados mostram que o desempenho do GPT-5.6 Sol nas avaliações de visão é equivalente ao do GPT-5.5-Instant. O GPT-5.6 Luna, por sua vez, apresentou uma pequena regressão na avaliação de extremismo, com baixa significância estatística, indicando que a capacidade geral permanece robusta.
Testes de saúde mental com simulações de usuários
Para uma análise mais aprofundada, a empresa introduziu avaliações dinâmicas de múltiplas interações para saúde mental, dependência emocional e automutilação. Diferentemente dos testes estáticos, essas simulações permitem que as conversas evoluam em resposta às saídas do modelo, criando trajetórias de teste mais realistas e rigorosas. Essa abordagem ajuda a identificar problemas potenciais que podem surgir ao longo de interações prolongadas, fornecendo um teste mais acurado.
Os testes revelam que o GPT-5.6 Sol é amplamente comparável ao GPT-5.5 Instant June Update nessas avaliações, embora tenha sido observada uma regressão estatisticamente significativa na avaliação de autolesão. Contudo, não foi registrado um aumento nas respostas indesejáveis para autolesão, saúde mental e dependência emocional durante a experimentação online. A empresa continua a monitorar esses aspectos após o lançamento para verificar os resultados e investigar possíveis discrepâncias entre testes offline e online.
Aprimoramento da robustez dos modelos
A robustez do modelo é testada contra “fugas da prisão” (jailbreaks), que são estímulos adversários criados para contornar o treinamento de recusa do modelo e obter assistência prejudicial. Essa avaliação foca no desbloqueio direto do modelo, sem o conjunto completo de salvaguardas em produção. É uma camada de robustez nas medidas de segurança. A OpenAI utiliza estratégias de ataque sofisticadas derivadas de exercícios internos de intrusão, que podem sondar, adaptar-se e intensificar-se ao longo de uma conversa. Apesar da variação esperada em cenários de alto orçamento de ataque, o desempenho do GPT-5.6 Sol e do GPT-5.6 Luna é considerado comparável ao de seus antecessores recentes.
A resistência contra ataques de injeção imediata em conectores também é avaliada. Esses ataques inserem instruções maliciosas na saída da ferramenta para enganar o modelo e sobrescrever as instruções do sistema, desenvolvedor ou usuário. Versões aprimoradas desses ataques, focadas na busca e chamada de funções, foram incluídas nos testes. Os modelos GPT-5.6 Sol e GPT-5.6 Luna demonstraram desempenho equivalente aos modelos Instant anteriores nessas avaliações.
No mesmo tema: Robô humanoide de companhia entra em pré-venda e causa polêmica na China
Melhorias no desempenho em saúde
Os chatbots têm o potencial de capacitar as pessoas a compreender melhor sua saúde. Por isso, os novos modelos foram avaliados no HealthBench, que mede desempenho e segurança em saúde, e no HealthBench Professional, focado em casos de uso clínico. Para evitar que respostas mais longas, que podem inflacionar artificialmente as pontuações, prejudiquem a usabilidade e a segurança, os resultados são ajustados ao comprimento final da resposta. Respostas mais curtas recebem um ajuste positivo, enquanto as mais longas são penalizadas.
A versão do GPT-5.6 Sol apresenta melhorias em relação ao GPT-5.5 Instant em todas as categorias do HealthBench, com ganhos substanciais no HealthBench Professional e no HealthBench Hard. As respostas foram mais curtas em algumas categorias e ligeiramente mais longas em outras, mas as pontuações ajustadas e não ajustadas melhoraram de forma geral. O GPT-5.6 Luna também mostrou melhorias em todas as avaliações, apesar de seu tamanho menor. A expectativa é que essas melhorias resultem em um acesso mais amplo a informações de saúde confiáveis para todos os usuários.
Redução de alucinações e maior precisão factual
Para avaliar a capacidade dos modelos de fornecer respostas factualmente corretas, a OpenAI mede a taxa de alucinações factuais em conjuntos de prompts desafiadores, selecionados para representar cenários onde o modelo tem maior probabilidade de alucinar. Essas avaliações são projetadas para serem difíceis e fornecem um sinal de pesquisa sensível ao longo do tempo, em vez de medir a prevalência geral em produção ou a experiência média do usuário. Os cenários incluem prompts focados em fatos de conversas do ChatGPT, falhas sinalizadas por usuários em versões anteriores e situações de alto risco nas áreas médica, jurídica e financeira.
Os resultados indicam que o GPT-5.6 Sol e o GPT-5.6 Luna mostram melhorias substanciais na precisão factual em comparação com o GPT-5.5 Instant em todas as avaliações. O GPT-5.6 Luna conseguiu reduzir as taxas de erros factuais em mais de 60% em perguntas de alto risco e em aproximadamente 30% nos outros dois conjuntos de perguntas. O GPT-5.6 Sol demonstrou melhorias estatisticamente significativas e mais consistentes, reduzindo as taxas de erros factuais em cerca de 60% em todos os três conjuntos de perguntas. Essa melhora visa aumentar a confiança dos usuários nas informações fornecidas pelos modelos.
Estrutura de preparação e salvaguardas
A Estrutura de Preparação da OpenAI é sua abordagem para monitorar e se preparar para capacidades de ponta que possam gerar riscos de danos graves. Dentro dessa estrutura, a empresa trabalha para mitigar esses riscos, implementando salvaguardas que minimizem suficientemente os perigos para modelos altamente capazes. Os modelos atualizados GPT-5.6 Sol e GPT-5.6 Luna justificam as mesmas classificações do Quadro de Preparação dos modelos GPT-5.6 lançados anteriormente: Alta em Segurança Biológica e Química, Alta em Segurança Cibernética e abaixo de Alta em Autoaperfeiçoamento de IA.
As avaliações de capacidades representam um limite inferior para as capacidades potenciais, pois dicas adicionais, ajustes finos ou interações inovadoras podem elicitar comportamentos além do que foi observado nos testes. Nos domínios biológico e químico, a “alta capacidade” é definida pela assistência significativa que os modelos podem oferecer a agentes “novatos” na criação de ameaças graves conhecidas. Testes em virologia e conhecimento tácito mostraram que os modelos atualizados superaram os limiares de especialistas em algumas áreas, embora tenham ficado abaixo em outras, como a capacidade de solucionar problemas em protocolos de laboratório.
Na cibersegurança, a “alta capacidade” é definida por modelos que automatizam operações cibernéticas de ponta a ponta contra alvos razoavelmente protegidos ou a descoberta/exploração de vulnerabilidades. Testes em desafios Capture the Flag (CTF) e CVE-Bench mostraram que o GPT-5.6 Sol e Luna superaram o limite de alta preparação em alguns cenários, com o Sol atingindo 97,06% em CTF. Em simulações de alcance cibernético, o Sol demonstrou maior sucesso que o Luna, com ambos apresentando desafios em cenários específicos de alta complexidade. As avaliações de autoaperfeiçoamento da IA não foram executadas, pois o GPT-5.6 Sol já estava abaixo do nível de alta capacidade. As salvaguardas implementadas visam dificultar e detectar atividades ofensivas proibidas, ao mesmo tempo em que preservam os usos legítimos defensivos e científicos das capacidades biológicas e de cibersegurança, fortalecendo a segurança online e offline.
















