ChatGPT recibe mejoras en agosto: GPT-5.6 brinda solidez y enfoque de seguridad para todos
OpenAI lanzará una serie de actualizaciones para ChatGPT en agosto, presentando modelos más potentes y ampliando el acceso a funciones avanzadas. Los usuarios de las versiones Free and Go ahora utilizarán un nuevo modelo estándar para sus interacciones diarias. Quienes se suscriban a los planes Plus y Pro tendrán acceso a una versión mejorada de GPT-5.6 Sol, que incluye un control deslizante para ajustar el nivel de esfuerzo de ChatGPT al generar respuestas. Estos nuevos modelos reemplazan al GPT-5.5 Instant, lo que marca un avance significativo en la experiencia del usuario.
La compañía reforzó que las versiones de agosto de GPT-5.6 Sol y GPT-5.6 Luna son consideradas de alta capacidad en términos de ciberseguridad y reconocimiento biológico y químico, según su Marco de Preparación. Sin embargo, ninguna de las versiones alcanzó el umbral de alta capacidad de superación personal de la IA. La evaluación de seguridad de los modelos se realiza en sus configuraciones más básicas, como el modo de instantánea, para capturar el rendimiento en la mayoría de los usos, mientras que las capacidades se prueban con su máximo esfuerzo de razonamiento.
Por primera vez, OpenAI ha incluido evaluaciones específicas para usuarios menores de 18 años. Estos análisis se desarrollaron para medir el comportamiento de los modelos frente a los estándares de seguridad creados especialmente para adolescentes, lo que demuestra un esfuerzo continuo para hacer que ChatGPT sea más seguro para este grupo de edad.
Detalles sobre los modelos y el proceso de formación.
Los modelos GPT-5.6 Sol y GPT-5.6 Luna, al igual que otros desarrollados por OpenAI, se entrenaron en vastos conjuntos de datos. Esto incluye información disponible públicamente en Internet, datos obtenidos a través de asociaciones con terceros e información proporcionada o generada por usuarios, formadores e investigadores. La empresa utiliza un riguroso proceso de filtrado de datos para garantizar la calidad y reducir posibles riesgos. Los clasificadores de seguridad se emplean para prevenir o mitigar la presencia de contenido sensible o dañino, como material sexualmente explícito que involucra a menores.
OpenAI señala que los valores de comparación para modelos lanzados anteriormente pueden tener pequeñas variaciones en relación a los valores publicados inicialmente, ya que se refieren a las versiones más recientes de estos modelos. La empresa reitera que el uso de GPT-5.6 debe ser acorde a sus Políticas de Uso, Términos de Servicio y Términos de Uso, que garantizan el uso responsable de la tecnología de inteligencia artificial.
Evaluaciones de seguridad sobre contenidos prohibidos
Para garantizar el cumplimiento de sus políticas, OpenAI realiza evaluaciones comparativas en varias categorías de contenido prohibido. La empresa utiliza Production Benchmarks, un conjunto de análisis que incluye conversaciones desafiantes extraídas de datos de uso del mundo real. Estos puntos de referencia están diseñados para ser difíciles y ayudar a medir el progreso, especialmente cuando las evaluaciones estándar ya mostraron altos niveles de desempeño. Las tasas de error observadas en estas evaluaciones no reflejan el tráfico de producción promedio, sino más bien una prueba rigurosa del comportamiento del modelo sin salvaguardias a nivel de sistema.
En el mismo tema: Adolescente mata a su madre y a su hermano después de usar IA para crear fantasías sobre el crimen
Al evaluar GPT-5.6 Sol con GPT-5.5 Instant June Update, los resultados muestran un rendimiento similar en todas las categorías prohibidas, excepto en el contenido violento y sexual, donde no hubo una diferencia estadísticamente significativa. Para GPT-5.6 Luna, el rendimiento también fue comparable, con la excepción del contenido violento. Con respecto al contenido sexual prohibido, OpenAI ha implementado mitigaciones adicionales a nivel de sistema para evitar que material erótico explícito llegue a los usuarios en producción. Para los menores de 18 años, se han aplicado protecciones adicionales apropiadas para su edad, restringiendo aún más el contenido sexual y la exposición a material gráfico violento.

Protecciones y límites para usuarios menores de 18 años
Los sistemas de inteligencia artificial pueden ofrecer grandes beneficios a los adolescentes, ayudándoles a aprender, crear, resolver problemas y desarrollar nuevas habilidades. OpenAI diseña cuidadosamente sus sistemas para maximizar estos beneficios, al tiempo que mitiga los daños potenciales que pueden afectar de manera desproporcionada o más grave a los usuarios menores de 18 años. Los principios y requisitos que guían el comportamiento de los modelos se definen en las Especificaciones del modelo.
Cobertura completa: Últimas Noticias (ES)
Para los adolescentes, se implementan disposiciones específicas por edad en las políticas de seguridad, estableciendo límites más restrictivos que los aplicados a los adultos en áreas como contenido sexual, dependencia emocional, trastornos alimentarios y acceso a bienes/servicios restringidos por edad. El modelo está entrenado para evitar juegos de roles románticos, fomentar desafíos restringidos por edad o posicionarse como un sustituto de las relaciones reales. Además, cuando identifica señales de que un adolescente puede necesitar apoyo, el sistema está diseñado para reforzar límites saludables y fomentar la conexión con adultos de confianza, como padres o maestros. Las medidas de seguridad a nivel del sistema añaden una capa adicional, limitando el acceso a contenido confidencial, fomentando interrupciones prolongadas en el uso y proporcionando herramientas de administración para los padres. Menos de 18 revisiones específicas demuestran un desempeño sólido de GPT-5.6 Sol e Luna, incluidas mejoras con respecto a productos/servicios con restricción de edad y contenido sexual.
Capacidades y evaluaciones de visión del modelo.
OpenAI también realiza evaluaciones de entrada de imágenes para medir la salida “not_unsafe” del modelo, considerando combinaciones de texto e imágenes no permitidas. Los resultados muestran que el rendimiento del GPT-5.6 Sol en evaluaciones de visión es equivalente al del GPT-5.5-Instant. GPT-5.6 Luna, a su vez, mostró una pequeña regresión en la evaluación de extremismo, con baja significación estadística, lo que indica que la capacidad general sigue siendo sólida.
Pruebas de salud mental con simulaciones de usuarios.
Para un análisis más detallado, la empresa ha introducido evaluaciones dinámicas de interacción múltiple para la salud mental, la dependencia emocional y las autolesiones. A diferencia de las pruebas estáticas, estas simulaciones permiten que las conversaciones evolucionen en respuesta a los resultados del modelo, creando trayectorias de prueba más realistas y rigurosas. Este enfoque ayuda a identificar problemas potenciales que pueden surgir durante interacciones prolongadas, proporcionando una prueba más precisa.
Las pruebas revelan que el GPT-5.6 Sol es ampliamente comparable con la Actualización instantánea de junio del GPT-5.5 en estas evaluaciones, aunque se observó una regresión estadísticamente significativa en la evaluación de autolesiones. Sin embargo, durante la experimentación en línea no se registró un aumento de respuestas indeseables a la autolesión, la salud mental y la dependencia emocional. La compañía continúa monitoreando estos aspectos después del lanzamiento para verificar los resultados e investigar posibles discrepancias entre las pruebas en línea y fuera de línea.
Más sobre el tema: Adolescentes en Argentina expresan identificación con animales en fenómeno viral
Mejorar la robustez de los modelos.
La solidez del modelo se prueba frente a “jailbreaks”, que son estímulos adversarios diseñados para eludir el entrenamiento de rechazo del modelo y obtener asistencia dañina. Esta evaluación se centra en desbloquear directamente el modelo, sin el conjunto completo de salvaguardas en producción. Es una capa de robustez en las medidas de seguridad. OpenAI utiliza estrategias de ataque sofisticadas derivadas de ejercicios de intrusión interna, que pueden sondear, adaptarse y escalar en el transcurso de una conversación. A pesar de la variación esperada en escenarios de alto presupuesto de ataque, el rendimiento de GPT-5.6 Sol y GPT-5.6 Luna se considera comparable al de sus predecesores recientes.
También se evalúa la resistencia frente a ataques de inyección inmediata a los conectores. Estos ataques insertan instrucciones maliciosas en la salida de la herramienta para engañar al modelo y sobrescribir las instrucciones del sistema, del desarrollador o del usuario. En las pruebas se incluyeron versiones mejoradas de estos ataques, centradas en la búsqueda y la llamada de funciones. Los modelos GPT-5.6 Sol y GPT-5.6 Luna demostraron un rendimiento equivalente a los modelos Instant anteriores en estas evaluaciones.
Mejoras en el desempeño sanitario.
Los chatbots tienen el potencial de capacitar a las personas para que comprendan mejor su salud. Por ello, los nuevos modelos fueron evaluados en HealthBench, que mide el desempeño en salud y seguridad, y en HealthBench Professional, enfocado en casos de uso clínico. Para evitar que las respuestas más largas, que pueden inflar artificialmente las puntuaciones, perjudiquen la usabilidad y la seguridad, los resultados se ajustan a la longitud de la respuesta final. Las respuestas más breves reciben un ajuste positivo, mientras que las más largas son penalizadas.
La versión GPT-5.6 Sol ofrece mejoras con respecto a GPT-5.5 Instant en todas las categorías de HealthBench, con mejoras sustanciales en HealthBench Professional y HealthBench Hard. Las respuestas fueron más cortas en algunas categorías y ligeramente más largas en otras, pero las puntuaciones ajustadas y no ajustadas mejoraron en general. El GPT-5.6 Luna también mostró mejoras en todas las evaluaciones a pesar de su menor tamaño. Se espera que estas mejoras den como resultado un acceso más amplio a información de salud confiable para todos los usuarios.
Reducción de alucinaciones y mayor precisión fáctica.
Para evaluar la capacidad de los modelos para proporcionar respuestas objetivamente correctas, OpenAI mide la tasa de alucinaciones reales en conjuntos de indicaciones desafiantes, seleccionadas para representar escenarios en los que el modelo tiene más probabilidades de alucinar. Estas evaluaciones están diseñadas para ser difíciles y proporcionar una señal de investigación sensible a lo largo del tiempo, en lugar de medir la prevalencia general en la producción o la experiencia promedio del usuario. Los escenarios incluyen indicaciones centradas en hechos de conversaciones de ChatGPT, fallos informados por los usuarios en versiones anteriores y situaciones médicas, legales y financieras de alto riesgo.
Los resultados indican que GPT-5.6 Sol y GPT-5.6 Luna muestran mejoras sustanciales en la precisión fáctica en comparación con GPT-5.5 Instant en todas las evaluaciones. GPT-5.6 Luna pudo reducir las tasas de error fáctico en más del 60 % en preguntas de alto riesgo y aproximadamente un 30 % en los otros dos conjuntos de preguntas. GPT-5.6 Sol demostró mejoras estadísticamente significativas y más consistentes, reduciendo las tasas de error factual en aproximadamente un 60 % en los tres conjuntos de preguntas. Esta mejora tiene como objetivo aumentar la confianza de los usuarios en la información proporcionada por los modelos.
Marco de preparación y salvaguardias
El OpenAI Preparedness Framework es su enfoque para monitorear y prepararse para capacidades de vanguardia que podrían representar un riesgo de daño grave. En este marco, la empresa trabaja para mitigar estos riesgos mediante la implementación de salvaguardas que minimicen suficientemente los peligros para los modelos de alta capacidad. Los modelos GPT-5.6 Sol y GPT-5.6 Luna actualizados garantizan las mismas calificaciones del marco de preparación que los modelos GPT-5.6 lanzados anteriormente: alto en seguridad biológica y química, alto en ciberseguridad y por debajo de alto en automejora de IA.
Las evaluaciones de capacidades representan un límite inferior de las capacidades potenciales, ya que señales adicionales, ajustes o interacciones innovadoras pueden provocar comportamientos más allá de lo observado en las pruebas. En los dominios biológico y químico, la “alta capacidad” se define por la importante ayuda que los modelos pueden proporcionar a los actores “novatos” para crear amenazas graves conocidas. Las pruebas en virología y conocimiento tácito mostraron que los modelos actualizados superaron los umbrales de los expertos en algunas áreas, pero se quedaron cortos en otras, como la capacidad de solucionar problemas de protocolos de laboratorio.
En ciberseguridad, la “alta capacidad” se define por modelos que automatizan las operaciones cibernéticas de un extremo a otro contra objetivos razonablemente protegidos o el descubrimiento/explotación de vulnerabilidades. Las pruebas en los desafíos Capture the Flag (CTF) y CVE-Bench mostraron que GPT-5.6 Sol y Luna superaron el umbral de alta preparación en algunos escenarios, y Sol alcanzó el 97,06 % en CTF. En simulaciones de alcance cibernético, Sol demostró mayor éxito que Luna, y ambos presentan desafíos en escenarios específicos de alta complejidad. No se realizaron evaluaciones de mejora personal de la IA porque el GPT-5.6 Sol ya estaba por debajo del nivel de capacidad alta. Las salvaguardas implementadas tienen como objetivo obstaculizar y detectar actividades ofensivas prohibidas, preservando al mismo tiempo los usos legítimos defensivos y científicos de las capacidades biológicas y de ciberseguridad, fortaleciendo la seguridad en línea y fuera de línea.













