ChatGPT ontvangt verbeteringen in augustus: GPT-5.6 brengt robuustheid en veiligheidsfocus voor iedereen
OpenAI brengt in augustus een reeks updates voor ChatGPT uit, waarbij krachtigere modellen worden geïntroduceerd en de toegang tot geavanceerde functies wordt uitgebreid. Gebruikers van de Free- en Go-versies zullen nu een nieuw standaardmodel gebruiken voor hun dagelijkse interacties. Degenen die zich abonneren op de Plus- en Pro-abonnementen hebben toegang tot een verbeterde versie van GPT-5.6 Sol, die een schuifregelaar bevat om de mate van inspanning van ChatGPT aan te passen bij het genereren van reacties. Deze nieuwe modellen vervangen GPT-5.5 Instant en betekenen een aanzienlijke vooruitgang in de gebruikerservaring.
Het bedrijf benadrukte dat de augustusversies van GPT-5.6 Sol en GPT-5.6 Luna volgens het Preparation Framework als hoge capaciteit worden beschouwd in termen van cyberbeveiliging en biologische en chemische herkenning. Geen van beide versies bereikte echter de drempel van hoge capaciteit op het gebied van zelfverbetering van AI. Beveiligingsbeoordeling van modellen wordt uitgevoerd op de meest basale instellingen, zoals de snapshot-modus, om de prestaties voor de meeste toepassingen vast te leggen, terwijl de mogelijkheden worden getest op hun maximale redeneringsinspanning.
Voor het eerst heeft OpenAI specifieke beoordelingen opgenomen voor gebruikers onder de 18 jaar. Deze analyses zijn ontwikkeld om het gedrag van modellen te meten aan de hand van beveiligingsstandaarden die speciaal voor tieners zijn gemaakt, wat een voortdurende inspanning aantoont om ChatGPT veiliger te maken voor deze leeftijdsgroep.
Details over de modellen en het trainingsproces
De GPT-5.6 Sol- en GPT-5.6 Luna-modellen zijn, net als andere die door OpenAI zijn ontwikkeld, getraind op enorme datasets. Dit omvat informatie die publiekelijk beschikbaar is op internet, gegevens verkregen via partnerschappen met derde partijen, en informatie die wordt verstrekt of gegenereerd door gebruikers, opleiders en onderzoekers. Het bedrijf maakt gebruik van een rigoureus gegevensfilteringsproces om de kwaliteit te garanderen en mogelijke risico’s te verminderen. Veiligheidsclassificatoren worden gebruikt om de aanwezigheid van gevoelige of schadelijke inhoud, zoals seksueel expliciet materiaal waarbij minderjarigen betrokken zijn, te voorkomen of te beperken.
OpenAI wijst erop dat vergelijkingswaarden voor eerder uitgebrachte modellen kleine variaties kunnen hebben ten opzichte van de aanvankelijk gepubliceerde waarden, aangezien deze verwijzen naar de meest recente versies van deze modellen. Het bedrijf herhaalt dat het gebruik van GPT-5.6 in overeenstemming moet zijn met zijn gebruiksbeleid, servicevoorwaarden en gebruiksvoorwaarden, die het verantwoorde gebruik van kunstmatige intelligentietechnologie garanderen.
Beveiligingsbeoordelingen van verboden inhoud
Om ervoor te zorgen dat het beleid wordt nageleefd, voert OpenAI benchmarking uit voor verschillende categorieën verboden inhoud. Het bedrijf maakt gebruik van Production Benchmarks, een reeks analyses die uitdagende gesprekken omvatten die zijn ontleend aan gebruiksgegevens uit de praktijk. Deze benchmarks zijn ontworpen om moeilijk te zijn en de voortgang te helpen meten, vooral daar waar standaardbeoordelingen al hoge prestatieniveaus lieten zien. De foutenpercentages die in deze evaluaties worden waargenomen, weerspiegelen niet het gemiddelde productieverkeer, maar eerder een rigoureuze test van het gedrag van het model zonder waarborgen op systeemniveau.
Meer over dit onderwerp: OpenAI: ChatGPT lanceert zijn eigen cyberaanval
Als we GPT-5.6 Sol vergelijken met de GPT-5.5 Instant June Update, laten de resultaten vergelijkbare prestaties zien in alle verboden categorieën, behalve voor gewelddadige en seksuele inhoud, waar er geen statistisch significant verschil was. Voor GPT-5.6 Luna waren de prestaties ook vergelijkbaar, met uitzondering van gewelddadige inhoud. Wat betreft verboden seksuele inhoud heeft OpenAI aanvullende maatregelen op systeemniveau geïmplementeerd om te voorkomen dat expliciet erotisch materiaal gebruikers in de productie bereikt. Voor personen onder de 18 jaar zijn aanvullende leeftijdsadequate beschermingsmaatregelen toegepast, waardoor seksuele inhoud en blootstelling aan expliciet gewelddadig materiaal verder worden beperkt.

Beveiligingen en limieten voor gebruikers onder de 18 jaar
Systemen voor kunstmatige intelligentie kunnen tieners grote voordelen bieden, omdat ze hen kunnen helpen bij het leren, creëren, oplossen van problemen en het ontwikkelen van nieuwe vaardigheden. OpenAI ontwerpt zijn systemen zorgvuldig om deze voordelen te maximaliseren, terwijl potentiële schade wordt beperkt die gebruikers onder de 18 jaar disproportioneel of ernstiger kan treffen. De principes en vereisten die het gedrag van modellen sturen, zijn gedefinieerd in de modelspecificaties.
Voor tieners zijn leeftijdsspecifieke bepalingen geïmplementeerd in het veiligheidsbeleid, waarbij strengere grenzen worden vastgesteld dan die voor volwassenen op gebieden als seksuele inhoud, emotionele afhankelijkheid, eetstoornissen en toegang tot goederen/diensten met een leeftijdsbeperking. Het model is getraind om romantisch rollenspel te vermijden, leeftijdsgebonden uitdagingen aan te moedigen of zichzelf te positioneren als vervanging voor echte relaties. Wanneer het bovendien tekenen signaleert dat een tiener mogelijk ondersteuning nodig heeft, is het systeem ontworpen om gezonde grenzen te versterken en de verbinding met vertrouwde volwassenen, zoals ouders of leraren, aan te moedigen. Beveiligingsmaatregelen op systeemniveau voegen een extra laag toe, beperken de toegang tot gevoelige inhoud, stimuleren langere gebruiksonderbrekingen en bieden beheertools voor ouders. Onder de 18 specifieke beoordelingen laten solide prestaties zien van GPT-5.6 Sol e Luna, inclusief verbeteringen met betrekking tot producten/diensten met leeftijdsbeperking en seksuele inhoud.
Modelvisiemogelijkheden en beoordelingen
OpenAI voert ook evaluaties van beeldinvoer uit om de “not_unsafe”-uitvoer van het model te meten, rekening houdend met niet-toegestane combinaties van tekst en afbeeldingen. Uit de resultaten blijkt dat de prestaties van de GPT-5.6 Sol bij gezichtsbeoordelingen gelijkwaardig zijn aan die van de GPT-5.5-Instant. GPT-5.6 Luna liet op haar beurt een kleine achteruitgang zien in de beoordeling van het extremisme, met een lage statistische significantie, wat aangeeft dat de algehele capaciteit robuust blijft.
Testen van de geestelijke gezondheid met gebruikerssimulaties
Voor verdere analyse heeft het bedrijf dynamische multi-interactiebeoordelingen geïntroduceerd voor geestelijke gezondheid, emotionele afhankelijkheid en zelfbeschadiging. In tegenstelling tot statische tests zorgen deze simulaties ervoor dat gesprekken zich kunnen ontwikkelen als reactie op de uitkomsten van het model, waardoor realistischere en rigoureuzere testtrajecten ontstaan. Deze aanpak helpt bij het identificeren van potentiële problemen die kunnen optreden bij langdurige interacties, waardoor een nauwkeurigere test ontstaat.
Uit tests blijkt dat de GPT-5.6 Sol in deze beoordelingen in grote lijnen vergelijkbaar is met de GPT-5.5 Instant June Update, hoewel er een statistisch significante achteruitgang werd waargenomen in de beoordeling van zelfbeschadiging. Tijdens de online experimenten werd echter geen toename van ongewenste reacties op zelfbeschadiging, geestelijke gezondheid en emotionele afhankelijkheid waargenomen. Het bedrijf blijft deze aspecten na de lancering monitoren om de resultaten te verifiëren en mogelijke discrepanties tussen offline en online testen te onderzoeken.
Verbetering van de robuustheid van modellen
De robuustheid van het model wordt getest aan de hand van “jailbreaks”, dit zijn vijandige stimuli die zijn ontworpen om de weigeringstraining van het model te omzeilen en schadelijke hulp te verkrijgen. Deze beoordeling is gericht op het direct ontsluiten van het model, zonder de volledige reeks waarborgen in de productie. Het is een laag van robuustheid in beveiligingsmaatregelen. OpenAI maakt gebruik van geavanceerde aanvalsstrategieën die zijn afgeleid van interne inbraakoefeningen en die in de loop van een gesprek kunnen onderzoeken, aanpassen en escaleren. Ondanks de verwachte variatie in scenario’s met een hoog aanvalsbudget, worden de prestaties van GPT-5.6 Sol en GPT-5.6 Luna als vergelijkbaar beschouwd met hun recente voorgangers.
Lees meer: Menselijke fouten bij OpenAI veroorzaken een AI-cyberaanval op het Hugging Face-platform
De weerstand tegen directe injectieaanvallen op connectoren wordt ook geëvalueerd. Deze aanvallen voegen kwaadaardige instructies toe aan de uitvoer van het hulpprogramma om het model te misleiden en systeem-, ontwikkelaars- of gebruikersinstructies te overschrijven. Verbeterde versies van deze aanvallen, gericht op zoeken en het aanroepen van functies, zijn in de tests opgenomen. De GPT-5.6 Sol- en GPT-5.6 Luna-modellen lieten in deze evaluaties gelijkwaardige prestaties zien als eerdere Instant-modellen.
Verbeteringen in de gezondheidsprestaties
Chatbots hebben het potentieel om mensen in staat te stellen hun gezondheid beter te begrijpen. Daarom werden de nieuwe modellen geëvalueerd in HealthBench, dat gezondheidsprestaties en veiligheid meet, en in HealthBench Professional, gericht op klinische gebruiksscenario’s. Om te voorkomen dat langere reacties, die scores kunstmatig kunnen verhogen, de bruikbaarheid en veiligheid schaden, worden de resultaten aangepast aan de uiteindelijke reactielengte. Kortere reacties krijgen een positieve aanpassing, terwijl langere reacties worden bestraft.
De GPT-5.6 Sol-release levert verbeteringen ten opzichte van GPT-5.5 Instant in alle HealthBench-categorieën, met aanzienlijke winsten in HealthBench Professional en HealthBench Hard. De reacties waren korter in sommige categorieën en iets langer in andere, maar aangepaste en niet-gecorrigeerde scores verbeterden over het algemeen. De GPT-5.6 Luna liet ondanks zijn kleinere formaat ook verbeteringen zien in alle evaluaties. Deze verbeteringen zullen naar verwachting resulteren in een bredere toegang tot betrouwbare gezondheidsinformatie voor alle gebruikers.
Verminderde hallucinaties en verhoogde feitelijke nauwkeurigheid
Om het vermogen van modellen om feitelijk correcte antwoorden te geven te beoordelen, meet OpenAI het aantal feitelijke hallucinaties in reeksen uitdagende aanwijzingen, geselecteerd om scenario’s weer te geven waarin het model het meest waarschijnlijk zal hallucineren. Deze beoordelingen zijn ontworpen om moeilijk te zijn en in de loop van de tijd een gevoelig onderzoekssignaal te geven, in plaats van de algehele prevalentie in de productie of de gemiddelde gebruikerservaring te meten. Scenario’s omvatten op feiten gerichte aanwijzingen uit ChatGPT-gesprekken, door gebruikers gerapporteerde crashes in eerdere versies en risicovolle medische, juridische en financiële situaties.
De resultaten geven aan dat GPT-5.6 Sol en GPT-5.6 Luna in alle evaluaties substantiële verbeteringen in feitelijke nauwkeurigheid laten zien vergeleken met GPT-5.5 Instant. GPT-5.6 Luna kon de feitelijke foutenpercentages met meer dan 60% verlagen bij vragen met een hoge inzet en met ongeveer 30% bij de andere twee sets vragen. GPT-5.6 Sol liet statistisch significante en meer consistente verbeteringen zien, waardoor het aantal feitelijke fouten met ongeveer 60% daalde voor alle drie de vragenreeksen. Deze verbetering heeft tot doel het vertrouwen van gebruikers in de informatie van de modellen te vergroten.
Paraatheidskader en waarborgen
Over hetzelfde thema: Sam Altman gaf toe: het kunstmatige intelligentiesysteem OpenAI voert ‘autonome’ en ongekende aanvallen uit op een ander bedrijf
Het OpenAI Preparedness Framework is de benadering van het monitoren en voorbereiden op randcapaciteiten die een risico op ernstige schade kunnen opleveren. Binnen dit raamwerk probeert het bedrijf deze risico’s te beperken door veiligheidsmaatregelen te implementeren die de gevaren voor zeer capabele modellen voldoende minimaliseren. De bijgewerkte GPT-5.6 Sol- en GPT-5.6 Luna-modellen garanderen dezelfde Readiness Framework-beoordelingen als de eerder uitgebrachte GPT-5.6-modellen: hoog in biologische en chemische beveiliging, hoog in cyberbeveiliging en lager dan hoog in AI-zelfverbetering.
Capaciteitsbeoordelingen vertegenwoordigen een ondergrens voor potentiële capaciteiten, omdat aanvullende signalen, afstemming of innovatieve interacties gedrag kunnen uitlokken dat verder gaat dan wat tijdens het testen werd waargenomen. Op biologisch en chemisch gebied wordt ‘hoge capaciteit’ gedefinieerd door de aanzienlijke hulp die modellen kunnen bieden aan ‘beginnende’ actoren bij het creëren van bekende ernstige bedreigingen. Uit tests op het gebied van virologie en stilzwijgende kennis bleek dat de bijgewerkte modellen op sommige gebieden de drempels van experts overtroffen, terwijl ze op andere gebieden tekortschoten, zoals het vermogen om problemen met laboratoriumprotocollen op te lossen.
Op het gebied van cyberbeveiliging wordt ‘hoge capaciteit’ gedefinieerd door modellen die end-to-end cyberoperaties tegen redelijk beschermde doelen of de ontdekking/exploitatie van kwetsbaarheden automatiseren. Uit tests met Capture the Flag (CTF) en CVE-Bench-uitdagingen bleek dat GPT-5.6 Sol en Luna in sommige scenario’s de hoge gereedheidsdrempel overtroffen, waarbij Sol een CTF van 97,06% behaalde. Bij simulaties van cyberbereik toonde Sol meer succes dan Luna, waarbij beide uitdagingen met zich meebrachten in specifieke scenario’s met hoge complexiteit. Er werden geen AI-zelfverbeteringsbeoordelingen uitgevoerd omdat de GPT-5.6 Sol zich al onder het hoge capaciteitsniveau bevond. De geïmplementeerde waarborgen zijn bedoeld om verboden offensieve activiteiten te belemmeren en op te sporen, terwijl het legitieme defensieve en wetenschappelijke gebruik van biologische en cyberbeveiligingscapaciteiten behouden blijft en de online en offline veiligheid wordt versterkt.















