ChatGPT riceve miglioramenti ad agosto: GPT-5.6 offre a tutti robustezza e attenzione alla sicurezza
OpenAI rilascerà una serie di aggiornamenti a ChatGPT ad agosto, introducendo modelli più potenti e ampliando l’accesso a funzionalità avanzate. Gli utenti delle versioni Free e Go utilizzeranno ora un nuovo modello standard per le loro interazioni quotidiane. Coloro che si abbonano ai piani Plus e Pro avranno accesso a una versione migliorata di GPT-5.6 Sol, che include uno slider per regolare il livello di impegno di ChatGPT durante la generazione di risposte. Questi nuovi modelli sostituiscono GPT-5.5 Instant, segnando un significativo progresso nell’esperienza dell’utente.
La società ha ribadito che le versioni di agosto di GPT-5.6 Sol e GPT-5.6 Luna sono considerate ad alta capacità in termini di sicurezza informatica e riconoscimento biologico e chimico, secondo il suo quadro di preparazione. Nessuna delle due versioni, tuttavia, ha raggiunto la soglia dell’elevata capacità di auto-miglioramento dell’IA. La valutazione della sicurezza dei modelli viene eseguita con le impostazioni più basilari, come la modalità snapshot, per acquisire prestazioni nella maggior parte degli usi, mentre le capacità vengono testate al massimo sforzo di ragionamento.
Per la prima volta, OpenAI ha incluso valutazioni specifiche per gli utenti sotto i 18 anni. Queste analisi sono state sviluppate per misurare il comportamento dei modelli rispetto agli standard di sicurezza creati appositamente per gli adolescenti, dimostrando uno sforzo continuo per rendere ChatGPT più sicuro per questa fascia di età.
Dettagli sui modelli e sul processo di formazione
I modelli GPT-5.6 Sol e GPT-5.6 Luna, come altri sviluppati da OpenAI, sono stati addestrati su vasti set di dati. Ciò include informazioni disponibili pubblicamente su Internet, dati ottenuti attraverso partnership con terze parti e informazioni fornite o generate da utenti, formatori e ricercatori. L’azienda utilizza un rigoroso processo di filtraggio dei dati per garantire la qualità e ridurre i possibili rischi. I classificatori di sicurezza vengono utilizzati per prevenire o mitigare la presenza di contenuti sensibili o dannosi, come materiale sessualmente esplicito che coinvolge minori.
OpenAI sottolinea che i valori di confronto per i modelli rilasciati in precedenza potrebbero presentare piccole variazioni rispetto ai valori inizialmente pubblicati, poiché si riferiscono alle versioni più recenti di tali modelli. L’azienda ribadisce che l’utilizzo di GPT-5.6 deve essere conforme alle sue Politiche di utilizzo, Termini di servizio e Termini di utilizzo, che garantiscono l’uso responsabile della tecnologia di intelligenza artificiale.
Valutazioni di sicurezza sui contenuti vietati
Per garantire la conformità con le sue politiche, OpenAI esegue benchmark tra diverse categorie di contenuti vietati. L’azienda utilizza Production Benchmarks, una serie di analisi che include conversazioni stimolanti tratte da dati di utilizzo del mondo reale. Questi parametri di riferimento sono progettati per essere difficili e aiutare a misurare i progressi, soprattutto laddove le valutazioni standard hanno già mostrato elevati livelli di prestazione. I tassi di errore osservati in queste valutazioni non riflettono il traffico di produzione medio, ma piuttosto un test rigoroso del comportamento del modello senza garanzie a livello di sistema.
Di più sul tema: Giochi vs libri: come i giovani possono conciliare divertimento e studio
Valutando GPT-5.6 Sol rispetto a GPT-5.5 Instant June Update, i risultati mostrano prestazioni simili in tutte le categorie vietate, ad eccezione dei contenuti violenti e sessuali, dove non è stata riscontrata alcuna differenza statisticamente significativa. Anche per GPT-5.6 Luna le prestazioni sono state paragonabili, ad eccezione dei contenuti violenti. Per quanto riguarda i contenuti sessuali vietati, OpenAI ha implementato un’ulteriore mitigazione a livello di sistema per impedire che materiale erotico esplicito raggiunga gli utenti in produzione. Per i minori di 18 anni sono state applicate ulteriori protezioni adeguate all’età, limitando ulteriormente i contenuti sessuali e l’esposizione a materiale esplicito violento.

Tutele e limiti per gli utenti minori di 18 anni
I sistemi di intelligenza artificiale possono offrire grandi vantaggi agli adolescenti, aiutandoli ad apprendere, creare, risolvere problemi e sviluppare nuove competenze. OpenAI progetta attentamente i suoi sistemi per massimizzare questi benefici, mitigando al contempo i potenziali danni che potrebbero colpire in modo sproporzionato o più grave gli utenti di età inferiore ai 18 anni. I principi e i requisiti che guidano il comportamento dei modelli sono definiti nelle Specifiche del modello.
Per gli adolescenti, nelle politiche di sicurezza vengono implementate disposizioni specifiche per età, stabilendo limiti più restrittivi rispetto a quelli applicati agli adulti in ambiti quali i contenuti sessuali, la dipendenza emotiva, i disturbi alimentari e l’accesso a beni/servizi soggetti a limiti di età. Il modello è addestrato per evitare giochi di ruolo romantici, incoraggiare sfide legate a limiti di età o posizionarsi come sostituto di relazioni reali. Inoltre, quando identifica i segnali che indicano che un adolescente potrebbe aver bisogno di sostegno, il sistema è progettato per rafforzare i confini sani e incoraggiare la connessione con adulti fidati, come genitori o insegnanti. Le misure di sicurezza a livello di sistema aggiungono un ulteriore livello, limitando l’accesso ai contenuti sensibili, incoraggiando interruzioni prolungate nell’utilizzo e fornendo strumenti di gestione per i genitori. Le recensioni specifiche Under 18 dimostrano le solide prestazioni di GPT-5.6 Sol e Luna, inclusi miglioramenti relativi a prodotti/servizi soggetti a limiti di età e contenuti sessuali.
Scopri di più: Un’adolescente uccide madre e fratello dopo aver usato l’intelligenza artificiale per creare fantasie sul crimine
Capacità e valutazioni della visione del modello
OpenAI esegue anche valutazioni dell’input delle immagini per misurare l’output “not_unsafe” del modello, considerando le combinazioni di testo e immagini non consentite. I risultati mostrano che le prestazioni del GPT-5.6 Sol nelle valutazioni della vista sono equivalenti a quelle del GPT-5.5-Instant. GPT-5.6 Luna, a sua volta, ha mostrato una piccola regressione nella valutazione dell’estremismo, con una bassa significatività statistica, indicando che la capacità complessiva rimane solida.
Test sulla salute mentale con simulazioni utente
Per ulteriori analisi, l’azienda ha introdotto valutazioni dinamiche multi-interazione per la salute mentale, la dipendenza emotiva e l’autolesionismo. A differenza dei test statici, queste simulazioni consentono alle conversazioni di evolversi in risposta agli output del modello, creando traiettorie di test più realistiche e rigorose. Questo approccio aiuta a identificare potenziali problemi che potrebbero sorgere nel corso di interazioni prolungate, fornendo un test più accurato.
I test rivelano che il GPT-5.6 Sol è ampiamente paragonabile al GPT-5.5 Instant June Update in queste valutazioni, sebbene sia stata osservata una regressione statisticamente significativa nella valutazione dell’autolesionismo. Tuttavia, durante la sperimentazione online non è stato registrato un aumento delle risposte indesiderate all’autolesionismo, alla salute mentale e alla dipendenza emotiva. L’azienda continua a monitorare questi aspetti dopo il lancio per verificare i risultati e indagare su potenziali discrepanze tra i test offline e online.
Migliorare la robustezza dei modelli
La robustezza del modello viene testata rispetto ai “jailbreak”, che sono stimoli contraddittori progettati per aggirare l’addestramento al rifiuto del modello e ottenere assistenza dannosa. Questa valutazione si concentra sullo sblocco diretto del modello, senza l’intera serie di garanzie in produzione. È uno strato di robustezza nelle misure di sicurezza. OpenAI utilizza sofisticate strategie di attacco derivate da esercizi di intrusione interna, che possono sondare, adattare e intensificare nel corso di una conversazione. Nonostante la variazione prevista negli scenari con budget di attacco elevato, le prestazioni di GPT-5.6 Sol e GPT-5.6 Luna sono considerate paragonabili a quelle dei loro recenti predecessori.
Viene valutata anche la resistenza agli attacchi immediati di iniezione sui connettori. Questi attacchi inseriscono istruzioni dannose nell’output dello strumento per ingannare il modello e sovrascrivere le istruzioni del sistema, dello sviluppatore o dell’utente. Nei test sono state incluse versioni migliorate di questi attacchi, focalizzate sulla ricerca e sul richiamo di funzioni. In queste valutazioni, i modelli GPT-5.6 Sol e GPT-5.6 Luna hanno dimostrato prestazioni equivalenti ai precedenti modelli Instant.
Sullo stesso tema: Adolescenti e giochi: lo studio dimostra che la dipendenza dai giochi ha un impatto negativo
Miglioramenti nelle prestazioni sanitarie
I chatbot hanno il potenziale per consentire alle persone di comprendere meglio la propria salute. Pertanto, i nuovi modelli sono stati valutati in HealthBench, che misura le prestazioni sanitarie e la sicurezza, e in HealthBench Professional, focalizzato su casi di utilizzo clinico. Per evitare che risposte più lunghe, che possono gonfiare artificialmente i punteggi, danneggino l’usabilità e la sicurezza, i risultati vengono adattati alla lunghezza della risposta finale. Le risposte più brevi ricevono un aggiustamento positivo, mentre quelle più lunghe vengono penalizzate.
La versione GPT-5.6 Sol offre miglioramenti rispetto a GPT-5.5 Instant in tutte le categorie HealthBench, con miglioramenti sostanziali in HealthBench Professional e HealthBench Hard. Le risposte sono state più brevi in alcune categorie e leggermente più lunghe in altre, ma i punteggi aggiustati e non aggiustati sono complessivamente migliorati. Anche il GPT-5.6 Luna ha mostrato miglioramenti in tutte le valutazioni nonostante le sue dimensioni più piccole. Si prevede che questi miglioramenti si tradurranno in un più ampio accesso a informazioni sanitarie affidabili per tutti gli utenti.
Allucinazioni ridotte e maggiore accuratezza dei fatti
Per valutare la capacità dei modelli di fornire risposte fattivamente corrette, OpenAI misura il tasso di allucinazioni reali in serie di istruzioni impegnative, selezionate per rappresentare scenari in cui è più probabile che il modello abbia allucinazioni. Queste valutazioni sono progettate per essere difficili e fornire un segnale di ricerca sensibile nel tempo, piuttosto che misurare la prevalenza complessiva nella produzione o nell’esperienza media dell’utente. Gli scenari includono suggerimenti focalizzati sui fatti provenienti da conversazioni ChatGPT, arresti anomali segnalati dagli utenti nelle versioni precedenti e situazioni mediche, legali e finanziarie ad alto rischio.
Di più sul tema: Gli adolescenti americani affrontano una frustrante ricerca di lavoro negli Stati Uniti e hanno il tasso di assunzione più basso della storia
I risultati indicano che GPT-5.6 Sol e GPT-5.6 Luna mostrano miglioramenti sostanziali nella precisione fattuale rispetto a GPT-5.5 Instant in tutte le valutazioni. GPT-5.6 Luna è stata in grado di ridurre i tassi di errore fattuale di oltre il 60% sulle domande ad alto rischio e di circa il 30% sulle altre due serie di domande. GPT-5.6 Sol ha dimostrato miglioramenti statisticamente significativi e più coerenti, riducendo i tassi di errore fattuale di circa il 60% in tutti e tre i set di domande. Questo miglioramento mira ad aumentare la fiducia degli utenti nelle informazioni fornite dai modelli.
Quadro di preparazione e misure di salvaguardia
L’OpenAI Preparedness Framework rappresenta il suo approccio al monitoraggio e alla preparazione per le capacità edge che potrebbero comportare un rischio di gravi danni. In questo quadro, l’azienda lavora per mitigare questi rischi implementando misure di salvaguardia che minimizzino sufficientemente i pericoli per i modelli altamente capaci. I modelli GPT-5.6 Sol e GPT-5.6 Luna aggiornati garantiscono le stesse valutazioni del Readiness Framework dei modelli GPT-5.6 rilasciati in precedenza: alto in sicurezza biologica e chimica, alto in sicurezza informatica e inferiore ad alto in auto-miglioramento dell’intelligenza artificiale.
Le valutazioni delle capacità rappresentano un limite inferiore alle capacità potenziali, poiché ulteriori segnali, perfezionamenti o interazioni innovative possono suscitare comportamenti oltre quanto osservato nei test. Nei settori biologico e chimico, l'”alta capacità” è definita dall’assistenza significativa che i modelli possono fornire agli attori “alle prime armi” nella creazione di minacce gravi note. Test di virologia e conoscenza tacita hanno dimostrato che i modelli aggiornati hanno superato le soglie degli esperti in alcune aree, mentre non sono stati all’altezza in altre, come la capacità di risolvere i problemi dei protocolli di laboratorio.
Nella sicurezza informatica, l'”alta capacità” è definita da modelli che automatizzano le operazioni informatiche end-to-end contro obiettivi ragionevolmente protetti o la scoperta/sfruttamento delle vulnerabilità. I test sulle sfide Capture the Flag (CTF) e CVE-Bench hanno mostrato che GPT-5.6 Sol e Luna hanno superato la soglia di prontezza elevata in alcuni scenari, con Sol che ha raggiunto il 97,06% in CTF. Nelle simulazioni della portata cibernetica, Sol ha dimostrato un successo maggiore rispetto a Luna, poiché entrambe presentano sfide in scenari specifici ad alta complessità. Le valutazioni di auto-miglioramento dell’IA non sono state eseguite poiché il GPT-5.6 Sol era già al di sotto del livello di capacità elevata. Le misure di salvaguardia implementate mirano a ostacolare e individuare attività offensive vietate, preservando al contempo i legittimi usi difensivi e scientifici delle capacità biologiche e di sicurezza informatica, rafforzando la sicurezza online e offline.














