ChatGPT modtager forbedringer i august: GPT-5.6 bringer robusthed og sikkerhedsfokus til alle

OpenAI ChatGPT
Foto: OpenAI ChatGPT - Foto: One Artist / Shutterstock.com

OpenAI udgiver en række opdateringer til ChatGPT i august, der introducerer mere kraftfulde modeller og udvider adgangen til avancerede funktioner. Brugere af Free- og Go-versionerne vil nu bruge en ny standardmodel til deres daglige interaktioner. De, der abonnerer på Plus- og Pro-planerne, vil have adgang til en forbedret version af GPT-5.6 Sol, som inkluderer en skyder til at justere ChatGPTs indsatsniveau, når de genererer svar. Disse nye modeller erstatter GPT-5.5 Instant, hvilket markerer et betydeligt fremskridt i brugeroplevelsen.

Virksomheden forstærkede, at august-versionerne af GPT-5.6 Sol og GPT-5.6 Luna betragtes som højkapacitet med hensyn til cybersikkerhed og biologisk og kemisk anerkendelse, ifølge dets forberedelsesramme. Ingen af ​​versionerne nåede imidlertid tærsklen for høj kapacitet i AI-selvforbedring. Sikkerhedsvurdering af modeller udføres ved deres mest basale indstillinger, såsom snapshot-tilstand, for at fange ydeevne på tværs af de fleste anvendelser, mens egenskaberne testes med deres maksimale ræsonnement.

For første gang har OpenAI inkluderet specifikke vurderinger for brugere under 18. Disse analyser blev udviklet til at måle modellers adfærd i forhold til sikkerhedsstandarder, der er skabt specielt til teenagere, hvilket viser en løbende indsats for at gøre ChatGPT sikrere for denne aldersgruppe.

Detaljer om modellerne og træningsprocessen

GPT-5.6 Sol- og GPT-5.6 Luna-modellerne blev ligesom andre udviklet af OpenAI trænet på enorme datasæt. Dette omfatter informationer, der er offentligt tilgængelige på internettet, data opnået gennem partnerskaber med tredjeparter og oplysninger leveret eller genereret af brugere, undervisere og forskere. Virksomheden anvender en streng datafiltreringsproces for at sikre kvalitet og reducere mulige risici. Sikkerhedsklassifikatorer bruges til at forhindre eller afbøde tilstedeværelsen af ​​følsomt eller skadeligt indhold, såsom seksuelt eksplicit materiale, der involverer mindreårige.

OpenAI påpeger, at sammenligningsværdier for tidligere udgivne modeller kan have små variationer i forhold til de oprindeligt offentliggjorte værdier, da de refererer til de seneste versioner af disse modeller. Virksomheden gentager, at brugen af ​​GPT-5.6 skal være i overensstemmelse med dens brugspolitikker, servicevilkår og brugsbetingelser, som garanterer ansvarlig brug af kunstig intelligens-teknologi.

Sikkerhedsvurderinger af forbudt indhold

For at sikre overholdelse af sine politikker udfører OpenAI benchmarking på tværs af flere kategorier af forbudt indhold. Virksomheden bruger produktionsbenchmarks, et sæt analyser, der inkluderer udfordrende samtaler hentet fra brugsdata fra den virkelige verden. Disse benchmarks er designet til at være vanskelige og hjælpe med at måle fremskridt, især hvor standardvurderinger allerede viste høje præstationsniveauer. De observerede fejlrater i disse evalueringer afspejler ikke den gennemsnitlige produktionstrafik, men snarere en streng test af modellens adfærd uden sikkerhedsforanstaltninger på systemniveau.

Ved at evaluere GPT-5.6 Sol mod GPT-5.5 Øjeblikkelig juni-opdatering, viser resultaterne lignende ydeevne på tværs af alle forbudte kategorier, undtagen for voldeligt og seksuelt indhold, hvor der ikke var nogen statistisk signifikant forskel. For GPT-5.6 Luna var ydeevnen også sammenlignelig, med undtagelse af voldeligt indhold. Med hensyn til forbudt seksuelt indhold har OpenAI implementeret yderligere afbødning på systemniveau for at forhindre eksplicit erotisk materiale i at nå ud til brugere i produktionen. For personer under 18 år er der blevet anvendt yderligere alderssvarende beskyttelse, hvilket yderligere begrænser seksuelt indhold og eksponering for grafisk voldeligt materiale.

ChatGPT-logo
ChatGPT-logo – Markus Mainka/ Shutterstock.com

Beskyttelser og grænser for brugere under 18 år

Kunstig intelligens-systemer kan tilbyde store fordele for teenagere, og hjælpe dem med at lære, skabe, løse problemer og udvikle nye færdigheder. OpenAI designer omhyggeligt sine systemer for at maksimere disse fordele, samtidig med at potentielle skader, der kan påvirke brugere under 18 år uforholdsmæssigt eller mere alvorligt. Principperne og kravene, der styrer modellernes adfærd, er defineret i modelspecifikationerne.

For teenagere er aldersspecifikke bestemmelser implementeret i sikkerhedspolitikker, der etablerer mere restriktive grænser end dem, der gælder for voksne på områder som seksuelt indhold, følelsesmæssig afhængighed, spiseforstyrrelser og adgang til aldersbegrænsede varer/tjenester. Modellen er trænet til at undgå romantisk rollespil, tilskynde til aldersbegrænsede udfordringer eller positionere sig selv som en erstatning for rigtige forhold. Derudover, når det identificerer tegn på, at en teenager kan have brug for støtte, er systemet designet til at styrke sunde grænser og tilskynde til forbindelse med betroede voksne, som forældre eller lærere. Sikkerhedsforanstaltninger på systemniveau tilføjer et ekstra lag, begrænser adgangen til følsomt indhold, tilskynder til længere pauser i brugen og leverer administrationsværktøjer til forældre. Under 18 specifikke anmeldelser viser solid ydeevne fra GPT-5.6 Sol e Luna, herunder forbedringer med hensyn til aldersbegrænsede produkter/tjenester og seksuelt indhold.

Model vision evner og vurderinger

OpenAI udfører også billedinput-evalueringer for at måle modellens “not_unsafe” output, i betragtning af ikke-tilladte tekst- og billedkombinationer. Resultaterne viser, at ydeevnen af ​​GPT-5.6 Sol i synsvurderinger svarer til den for GPT-5.5-Instant. GPT-5.6 Luna viste til gengæld en lille regression i ekstremismevurderingen med lav statistisk signifikans, hvilket indikerer, at den samlede kapacitet forbliver robust.

Test af mental sundhed med brugersimuleringer

Til yderligere analyse har virksomheden introduceret dynamiske multi-interaktionsvurderinger for mental sundhed, følelsesmæssig afhængighed og selvskade. I modsætning til statiske test tillader disse simuleringer samtaler at udvikle sig som reaktion på modeloutput, hvilket skaber mere realistiske og stringente testbaner. Denne tilgang hjælper med at identificere potentielle problemer, der kan opstå over længerevarende interaktioner, hvilket giver en mere præcis test.

Testning afslører, at GPT-5.6 Sol stort set er sammenlignelig med GPT-5.5 Instant June Update i disse vurderinger, selvom der blev observeret en statistisk signifikant regression i selvskadevurderingen. En stigning i uønskede reaktioner på selvskade, mental sundhed og følelsesmæssig afhængighed blev dog ikke registreret under onlineeksperimentet. Virksomheden fortsætter med at overvåge disse aspekter efter lanceringen for at verificere resultater og undersøge potentielle uoverensstemmelser mellem offline og online test.

Forbedring af robustheden af ​​modeller

Modellens robusthed er testet mod “jailbreaks”, som er modstridende stimuli designet til at omgå modellens afvisningstræning og opnå skadelig assistance. Denne vurdering fokuserer på direkte at låse modellen op uden det fulde sæt af sikkerhedsforanstaltninger i produktionen. Det er et lag af robusthed i sikkerhedsforanstaltninger. OpenAI bruger sofistikerede angrebsstrategier afledt af interne indtrængningsøvelser, som kan undersøge, tilpasse og eskalere i løbet af en samtale. På trods af den forventede variation i scenarier med højt angrebsbudget anses ydeevnen for GPT-5.6 Sol og GPT-5.6 Luna for at være sammenlignelig med deres seneste forgængere.

Modstand mod øjeblikkelige injektionsangreb på konnektorer vurderes også. Disse angreb indsætter ondsindede instruktioner i værktøjets output for at narre modellen og overskrive system-, udvikler- eller brugerinstruktioner. Forbedrede versioner af disse angreb, fokuseret på søgning og funktionskald, blev inkluderet i testene. GPT-5.6 Sol- og GPT-5.6 Luna-modellerne viste tilsvarende ydeevne som tidligere Instant-modeller i disse evalueringer.

Forbedringer i sundhedsydelsen

Chatbots har potentialet til at give folk mulighed for bedre at forstå deres helbred. Derfor blev de nye modeller evalueret i HealthBench, som måler sundhedsydelse og sikkerhed, og i HealthBench Professional med fokus på kliniske use cases. For at forhindre længere svar, som kunstigt kan forhøje scores, i at skade brugervenligheden og sikkerheden, justeres resultaterne til den endelige svarlængde. Kortere svar får en positiv justering, mens længere svar straffes.

GPT-5.6 Sol-udgivelsen leverer forbedringer i forhold til GPT-5.5 Instant på tværs af alle HealthBench-kategorier med betydelige gevinster i HealthBench Professional og HealthBench Hard. Svarene var kortere i nogle kategorier og lidt længere i andre, men justerede og ikke-justerede scores forbedrede generelt. GPT-5.6 Luna viste også forbedringer i alle evalueringer på trods af dens mindre størrelse. Disse forbedringer forventes at resultere i bredere adgang til pålidelige sundhedsoplysninger for alle brugere.

Reducerede hallucinationer og øget faktuel nøjagtighed

For at vurdere modellernes evne til at give faktuelt korrekte svar måler OpenAI frekvensen af ​​faktuelle hallucinationer i sæt af udfordrende prompter, udvalgt til at repræsentere scenarier, hvor modellen er mest tilbøjelig til at hallucinere. Disse vurderinger er designet til at være vanskelige og give et følsomt forskningssignal over tid i stedet for at måle den overordnede udbredelse i produktionen eller den gennemsnitlige brugeroplevelse. Scenarier inkluderer faktafokuserede prompter fra ChatGPT-samtaler, brugerrapporterede nedbrud i tidligere versioner og højrisiko medicinske, juridiske og økonomiske situationer.

Resultaterne indikerer, at GPT-5.6 Sol og GPT-5.6 Luna viser væsentlige forbedringer i faktuel nøjagtighed sammenlignet med GPT-5.5 Instant på tværs af alle evalueringer. GPT-5.6 Luna var i stand til at reducere faktuelle fejlprocenter med mere end 60 % på spørgsmål med høj indsats og cirka 30 % på de to andre sæt spørgsmål. GPT-5.6 Sol demonstrerede statistisk signifikante og mere konsistente forbedringer, hvilket reducerede faktuelle fejlprocenter med omkring 60 % på tværs af alle tre spørgsmålssæt. Denne forbedring har til formål at øge brugernes tillid til den information, modellerne giver.

Beredskabsramme og sikkerhedsforanstaltninger

OpenAI Preparedness Framework er dens tilgang til overvågning og forberedelse af edge-kapaciteter, der kan udgøre en risiko for alvorlig skade. Inden for disse rammer arbejder virksomheden på at mindske disse risici ved at implementere sikkerhedsforanstaltninger, der i tilstrækkelig grad minimerer farerne for meget dygtige modeller. De opdaterede GPT-5.6 Sol- og GPT-5.6 Luna-modeller garanterer de samme Readiness Framework-klassificeringer som de tidligere udgivne GPT-5.6-modeller: Høj i biologisk og kemisk sikkerhed, høj i cybersikkerhed og under Høj i AI-selvforbedring.

Evnevurderinger repræsenterer en nedre grænse for potentielle evner, da yderligere signaler, finjustering eller innovative interaktioner kan fremkalde adfærd ud over det, der blev observeret i test. På de biologiske og kemiske områder er “høj kapacitet” defineret ved den betydelige bistand, som modeller kan yde til “nybegyndere” med at skabe kendte alvorlige trusler. Test i virologi og tavs viden viste, at de opdaterede modeller oversteg eksperttærskler på nogle områder, mens de kommer til kort på andre, såsom evnen til at fejlfinde laboratorieprotokoller.

Inden for cybersikkerhed er “høj kapacitet” defineret af modeller, der automatiserer end-to-end cyberoperationer mod rimeligt beskyttede mål eller opdagelse/udnyttelse af sårbarheder. Test på Capture the Flag (CTF) og CVE-Bench-udfordringer viste, at GPT-5.6 Sol og Luna overskred den høje beredskabstærskel i nogle scenarier, hvor Sol opnåede 97,06 % i CTF. I simuleringer af cyberrækkevidde viste Sol større succes end Luna, idet begge præsenterede udfordringer i specifikke scenarier med høj kompleksitet. AI-selvforbedringsvurderinger blev ikke udført, da GPT-5.6 Sol allerede var under det høje kapacitetsniveau. De implementerede sikkerhedsforanstaltninger har til formål at hindre og afsløre forbudte offensive aktiviteter, samtidig med at den lovlige defensive og videnskabelige brug af biologiske og cybersikkerhedskapaciteter bevares, samtidig med at sikkerheden online og offline styrkes.

Se Også Seneste Nyheder (DA)

PS5-ejere får permanent adgang til to store titler i den virtuelle butik
Seneste Nyheder (DA) • 13/08/2026

PS5-ejere får permanent adgang til to store titler i den virtuelle butik

Epic Games Store gør 12 højprofilerede spil tilgængelige gratis på pc i 2026
Seneste Nyheder (DA) • 13/08/2026

Epic Games Store gør 12 højprofilerede spil tilgængelige gratis på pc i 2026

Teenager dræber mor og bror efter at have brugt kunstig intelligens til at skabe fantasier om forbrydelsen
Seneste Nyheder (DA) • 13/08/2026

Teenager dræber mor og bror efter at have brugt kunstig intelligens til at skabe fantasier om forbrydelsen

Bilabonnement betaler sig i 2026? Se sammenligningen med købet
Seneste Nyheder (DA) • 13/08/2026

Bilabonnement betaler sig i 2026? Se sammenligningen med købet

Interstellar komet 3I/ATLAS rejser med 58 km/s og vil få sin rute ændret af Jupiter
Seneste Nyheder (DA) • 13/08/2026

Interstellar komet 3I/ATLAS rejser med 58 km/s og vil få sin rute ændret af Jupiter

Toyota annoncerer global tilbagekaldelse af 655.000 Camry-enheder på grund af fejl på instrumentbrættet
Seneste Nyheder (DA) • 13/08/2026

Toyota annoncerer global tilbagekaldelse af 655.000 Camry-enheder på grund af fejl på instrumentbrættet

Prichard Colón, tidligere bokser, dør i en alder af 33 efter 11 års kamp mod hjerneskade
Seneste Nyheder (DA) • 13/08/2026

Prichard Colón, tidligere bokser, dør i en alder af 33 efter 11 års kamp mod hjerneskade

Bloker stjålne mobiltelefon: væsentlige trin til at beskytte dine data og spore enheden
Seneste Nyheder (DA) • 13/08/2026

Bloker stjålne mobiltelefon: væsentlige trin til at beskytte dine data og spore enheden

Google introducerer Pixel 11-serien med forbedret Tensor G6-chip og nyt Pixel Tag
Seneste Nyheder (DA) • 13/08/2026

Google introducerer Pixel 11-serien med forbedret Tensor G6-chip og nyt Pixel Tag

Langsom opladning af Galaxy Watch 9 og Ultra 2 tvinger brugerne til tricks som blæser og is
Seneste Nyheder (DA) • 13/08/2026

Langsom opladning af Galaxy Watch 9 og Ultra 2 tvinger brugerne til tricks som blæser og is

Uventet ankomst af Everspace 2: Galactic Edition booster Nintendo Switch 2-kataloget
Seneste Nyheder (DA) • 13/08/2026

Uventet ankomst af Everspace 2: Galactic Edition booster Nintendo Switch 2-kataloget

NASAs Webb-teleskop opdager en ny gigantisk planet med innovativ metode
Seneste Nyheder (DA) • 13/08/2026

NASAs Webb-teleskop opdager en ny gigantisk planet med innovativ metode

POCO X8 nærmer sig lanceringen med 9.000 mAh batteri og højopløsningsskærm
Seneste Nyheder (DA) • 13/08/2026

POCO X8 nærmer sig lanceringen med 9.000 mAh batteri og højopløsningsskærm

SpaceX raket kolliderer med Månen i en begivenhed overvåget af NASA, hvilket eliminerer risici for Jorden
Seneste Nyheder (DA) • 13/08/2026

SpaceX raket kolliderer med Månen i en begivenhed overvåget af NASA, hvilket eliminerer risici for Jorden

Sony stopper digitalt salg på PS3- og PS Vita-konsoller indtil juli 2027
Seneste Nyheder (DA) • 13/08/2026

Sony stopper digitalt salg på PS3- og PS Vita-konsoller indtil juli 2027