W sierpniu ChatGPT otrzyma ulepszenia: GPT-5.6 zapewnia wszystkim niezawodność i bezpieczeństwo
OpenAI wypuści w sierpniu serię aktualizacji ChatGPT, wprowadzających potężniejsze modele i rozszerzających dostęp do zaawansowanych funkcji. Użytkownicy wersji Free i Go będą teraz korzystać z nowego standardowego modelu codziennych interakcji. Ci, którzy subskrybują plany Plus i Pro, będą mieli dostęp do ulepszonej wersji GPT-5.6 Sol, która zawiera suwak umożliwiający dostosowanie poziomu wysiłku ChatGPT podczas generowania odpowiedzi. Te nowe modele zastępują GPT-5.5 Instant, co oznacza znaczny postęp w zakresie komfortu użytkowania.
Firma podkreśliła, że zgodnie z ramami przygotowawczymi sierpniowe wersje GPT-5.6 Sol i GPT-5.6 Luna są uważane za charakteryzujące się dużą wydajnością pod względem cyberbezpieczeństwa oraz rozpoznawania biologicznego i chemicznego. Żadna wersja nie osiągnęła jednak progu dużych możliwości samodoskonalenia AI. Ocena bezpieczeństwa modeli jest przeprowadzana przy ich najbardziej podstawowych ustawieniach, takich jak tryb migawki, aby uchwycić wydajność w większości zastosowań, podczas gdy możliwości są testowane przy maksymalnym wysiłku wnioskowania.
Po raz pierwszy OpenAI uwzględniło szczegółowe oceny użytkowników poniżej 18 roku życia. Analityki te opracowano w celu pomiaru zachowań modeli w odniesieniu do standardów bezpieczeństwa stworzonych specjalnie dla nastolatków, co świadczy o ciągłych wysiłkach mających na celu uczynienie ChatGPT bezpieczniejszym dla tej grupy wiekowej.
Szczegóły dotyczące modeli i procesu uczenia
Modele GPT-5.6 Sol i GPT-5.6 Luna, podobnie jak inne opracowane przez OpenAI, zostały przeszkolone na ogromnych zbiorach danych. Obejmuje to informacje publicznie dostępne w Internecie, dane uzyskane w ramach partnerstwa ze stronami trzecimi oraz informacje dostarczone lub wygenerowane przez użytkowników, trenerów i badaczy. Firma stosuje rygorystyczny proces filtrowania danych, aby zapewnić jakość i ograniczyć ewentualne ryzyko. Klasyfikatory bezpieczeństwa służą do zapobiegania lub ograniczania obecności wrażliwych lub szkodliwych treści, takich jak materiały o charakterze jednoznacznie seksualnym z udziałem nieletnich.
OpenAI zwraca uwagę, że wartości porównawcze dla wcześniej wydanych modeli mogą wykazywać niewielkie różnice w stosunku do wartości pierwotnie opublikowanych, gdyż odnoszą się one do najnowszych wersji tych modeli. Firma powtarza, że korzystanie z GPT-5.6 musi być zgodne z Polityką użytkowania, Warunkami świadczenia usług i Warunkami użytkowania, które gwarantują odpowiedzialne korzystanie z technologii sztucznej inteligencji.
Oceny bezpieczeństwa dotyczące zabronionych treści
Aby zapewnić zgodność ze swoimi zasadami, OpenAI przeprowadza testy porównawcze kilku kategorii zabronionych treści. Firma korzysta z testów porównawczych produkcji, zestawu analiz obejmujących trudne rozmowy zaczerpnięte z rzeczywistych danych o użytkowaniu. Te punkty odniesienia zostały zaprojektowane tak, aby były trudne i pomagały mierzyć postęp, zwłaszcza tam, gdzie standardowe oceny wykazały już wysoki poziom wyników. Poziomy błędów zaobserwowane w tych ocenach nie odzwierciedlają średniego ruchu produkcyjnego, ale raczej rygorystyczny test zachowania modelu bez zabezpieczeń na poziomie systemu.
Więcej na ten temat: Funkcja testów ChatGPT do tworzenia i eksportowania naklejek WhatsApp
Porównując GPT-5.6 Sol z natychmiastową czerwcową aktualizacją GPT-5.5, wyniki pokazują podobną skuteczność we wszystkich zabronionych kategoriach, z wyjątkiem treści zawierających przemoc i seksualność, gdzie nie było statystycznie istotnej różnicy. W przypadku GPT-5.6 Luna wydajność była również porównywalna, z wyjątkiem treści zawierających przemoc. Jeśli chodzi o zabronione treści o charakterze seksualnym, OpenAI wdrożyło dodatkowe środki zaradcze na poziomie systemu, aby zapobiec dotarciu materiałów erotycznych do użytkowników w fazie produkcyjnej. W przypadku osób poniżej 18 roku życia zastosowano dodatkowe zabezpieczenia odpowiednie do wieku, jeszcze bardziej ograniczając treści o charakterze seksualnym i narażenie na drastyczne materiały przedstawiające przemoc.

Zabezpieczenia i ograniczenia dla użytkowników poniżej 18 roku życia
Systemy sztucznej inteligencji mogą zaoferować nastolatkom ogromne korzyści, pomagając im uczyć się, tworzyć, rozwiązywać problemy i rozwijać nowe umiejętności. OpenAI starannie projektuje swoje systemy, aby zmaksymalizować te korzyści, jednocześnie łagodząc potencjalne szkody, które mogą nieproporcjonalnie lub bardziej dotkliwie dotknąć użytkowników poniżej 18 roku życia. Zasady i wymagania, które kierują zachowaniem modeli, są określone w Specyfikacji Modelu.
W przypadku nastolatków do polityk bezpieczeństwa wprowadzono przepisy dotyczące wieku, ustanawiające bardziej restrykcyjne limity niż te stosowane w przypadku dorosłych w takich obszarach, jak treści o charakterze seksualnym, uzależnienie emocjonalne, zaburzenia odżywiania i dostęp do towarów/usług objętych ograniczeniami wiekowymi. Modelka jest szkolona, aby unikać romantycznego odgrywania ról, zachęcać do wyzwań związanych z wiekiem lub pozycjonować się jako substytut prawdziwych związków. Ponadto, gdy zidentyfikuje oznaki, że nastolatek może potrzebować wsparcia, system ma za zadanie wzmacniać zdrowe granice i zachęcać do kontaktu z zaufanymi dorosłymi, takimi jak rodzice czy nauczyciele. Środki bezpieczeństwa na poziomie systemu dodają dodatkową warstwę, ograniczając dostęp do poufnych treści, zachęcając do dłuższych przerw w użytkowaniu i zapewniając rodzicom narzędzia do zarządzania. Poniżej 18 konkretnych recenzji wykazuje solidne działanie GPT-5.6 Sol e Luna, w tym ulepszenia dotyczące produktów/usług z ograniczeniami wiekowymi i treści seksualnych.
Modelowanie możliwości i ocen wizji
OpenAI przeprowadza również ocenę danych wejściowych obrazu, aby zmierzyć wynik „not_unsafe” modelu, biorąc pod uwagę niedozwolone kombinacje tekstu i obrazu. Wyniki pokazują, że skuteczność GPT-5.6 Sol w ocenie wzroku jest porównywalna z wydajnością GPT-5.5-Instant. Z kolei GPT-5.6 Luna wykazała niewielki regres w ocenie ekstremizmu, o niskiej istotności statystycznej, co wskazuje, że ogólna pojemność pozostaje solidna.
Testy zdrowia psychicznego z symulacjami użytkownika
Do dalszej analizy firma wprowadziła dynamiczne, wielointerakcyjne oceny zdrowia psychicznego, uzależnienia emocjonalnego i samookaleczeń. W przeciwieństwie do testów statycznych, symulacje te umożliwiają ewolucję rozmów w odpowiedzi na wyniki modelu, tworząc bardziej realistyczne i rygorystyczne trajektorie testów. Takie podejście pomaga zidentyfikować potencjalne problemy, które mogą pojawić się w wyniku długotrwałych interakcji, zapewniając dokładniejszy test.
Testy wykazały, że w tych ocenach GPT-5.6 Sol jest zasadniczo porównywalny z natychmiastową czerwcową aktualizacją GPT-5.5, chociaż zaobserwowano statystycznie istotny regres w ocenie samookaleczeń. Jednak podczas eksperymentu internetowego nie odnotowano wzrostu niepożądanych reakcji na samookaleczenie, zdrowie psychiczne i uzależnienie emocjonalne. Firma w dalszym ciągu monitoruje te aspekty po wprowadzeniu na rynek, aby zweryfikować wyniki i zbadać potencjalne rozbieżności między testami offline i online.
Poprawa wytrzymałości modeli
Odporność modelu jest testowana pod kątem „ucieczek z więzienia”, czyli bodźców kontradyktoryjnych mających na celu ominięcie szkolenia modela w zakresie odmowy i uzyskanie szkodliwej pomocy. Ocena ta koncentruje się na bezpośrednim odblokowaniu modelu, bez pełnego zestawu zabezpieczeń w produkcji. Jest to warstwa solidności środków bezpieczeństwa. OpenAI wykorzystuje wyrafinowane strategie ataków wywodzące się z wewnętrznych ćwiczeń w zakresie włamań, które mogą sondować, dostosowywać się i eskalować w trakcie rozmowy. Pomimo oczekiwanych różnic w scenariuszach wysokiego budżetu na ataki, wydajność GPT-5.6 Sol i GPT-5.6 Luna uważa się za porównywalną z ich najnowszymi poprzednikami.
Dowiedz się więcej: OpenAI odblokowuje nieograniczoną liczbę rozmów tekstowych dla bezpłatnych kont ChatGPT
Oceniana jest także odporność na natychmiastowe ataki wtryskowe na złącza. Ataki te polegają na wstawianiu złośliwych instrukcji do danych wyjściowych narzędzia w celu oszukania modelu i nadpisania instrukcji systemowych, programistycznych lub użytkownika. W testach uwzględniono ulepszone wersje tych ataków, skupiające się na wyszukiwaniu i wywoływaniu funkcji. W tych ocenach modele GPT-5.6 Sol i GPT-5.6 Luna wykazały porównywalną wydajność z poprzednimi modelami Instant.
Poprawa wyników zdrowotnych
Chatboty mogą pomóc ludziom lepiej zrozumieć swoje zdrowie. Dlatego też nowe modele zostały poddane ocenie w HealthBench, który mierzy stan zdrowia i bezpieczeństwo, oraz w HealthBench Professional, skupiającym się na zastosowaniach klinicznych. Aby dłuższe odpowiedzi, które mogą sztucznie zawyżać wyniki, nie szkodziły użyteczności i bezpieczeństwu, wyniki są dostosowywane do ostatecznej długości odpowiedzi. Krótsze odpowiedzi podlegają pozytywnej korekcie, natomiast dłuższe są karane.
Wersja GPT-5.6 Sol zapewnia ulepszenia w porównaniu z GPT-5.5 Instant we wszystkich kategoriach HealthBench, ze znacznymi korzyściami w HealthBench Professional i HealthBench Hard. Odpowiedzi były krótsze w niektórych kategoriach i nieco dłuższe w innych, ale ogólnie poprawiły się wyniki skorygowane i nieskorygowane. GPT-5.6 Luna również wykazała poprawę we wszystkich ocenach pomimo mniejszych rozmiarów. Oczekuje się, że te ulepszenia zaowocują szerszym dostępem do wiarygodnych informacji zdrowotnych dla wszystkich użytkowników.
Zmniejszone halucynacje i zwiększona dokładność faktów
Aby ocenić zdolność modeli do udzielania zgodnych z faktami odpowiedzi, OpenAI mierzy częstość występowania halucynacji opartych na faktach w zestawach trudnych podpowiedzi wybranych tak, aby reprezentowały scenariusze, w których model najprawdopodobniej będzie miał halucynacje. Oceny te mają być trudne i zapewniać wrażliwy sygnał badawczy w miarę upływu czasu, a nie mierzyć ogólną częstość występowania w produkcji lub przeciętne doświadczenie użytkownika. Scenariusze obejmują oparte na faktach podpowiedzi z rozmów ChatGPT, awarie zgłaszane przez użytkowników w poprzednich wersjach oraz sytuacje medyczne, prawne i finansowe wysokiego ryzyka.
Wyniki wskazują, że GPT-5.6 Sol i GPT-5.6 Luna wykazują znaczną poprawę dokładności faktów w porównaniu do GPT-5.5 Instant we wszystkich ocenach. GPT-5.6 Luna była w stanie zmniejszyć liczbę błędów rzeczowych o ponad 60% w przypadku pytań o wysoką stawkę i około 30% w przypadku pozostałych dwóch zestawów pytań. GPT-5.6 Sol wykazał statystycznie znaczącą i bardziej spójną poprawę, zmniejszając poziom błędów faktycznych o około 60% we wszystkich trzech zestawach pytań. To ulepszenie ma na celu zwiększenie zaufania użytkowników do informacji dostarczanych przez modele.
Ramy gotowości i zabezpieczenia
W tym samym temacie: OpenAI prezentuje nowy model Astry i postęp w rozumowaniu sztucznej inteligencji
Ramy gotowości OpenAI to podejście do monitorowania i przygotowywania się na możliwości brzegowe, które mogą stwarzać ryzyko poważnych szkód. W tym kontekście firma pracuje nad ograniczeniem tego ryzyka poprzez wdrożenie zabezpieczeń, które w wystarczającym stopniu minimalizują zagrożenia w przypadku modeli o dużych możliwościach. Zaktualizowane modele GPT-5.6 Sol i GPT-5.6 Luna gwarantują te same oceny w ramach programu gotowości, co poprzednio wydane modele GPT-5.6: wysoki poziom bezpieczeństwa biologicznego i chemicznego, wysoki poziom cyberbezpieczeństwa i niższy poziom samodoskonalenia AI.
Oceny zdolności stanowią dolną granicę potencjalnych możliwości, ponieważ dodatkowe wskazówki, dostrajanie lub innowacyjne interakcje mogą wywołać zachowania wykraczające poza to, co zaobserwowano w testach. W dziedzinach biologicznych i chemicznych „wysoką zdolność” definiuje się jako znaczącą pomoc, jaką modele mogą zapewnić „nowicjuszom” podmiotom w tworzeniu znanych poważnych zagrożeń. Testy z zakresu wirusologii i wiedzy ukrytej wykazały, że zaktualizowane modele w niektórych obszarach przekroczyły progi ekspertów, a w innych odpadły, np. zdolność rozwiązywania problemów z protokołami laboratoryjnymi.
W cyberbezpieczeństwie „dużą pojemność” definiuje się przez modele, które automatyzują kompleksowe operacje cybernetyczne przeciwko odpowiednio chronionym celom lub odkrywaniu/wykorzystywaniu luk w zabezpieczeniach. Testy w ramach wyzwań Capture the Flag (CTF) i CVE-Bench wykazały, że GPT-5.6 Sol i Luna przekroczyły w niektórych scenariuszach wysoki próg gotowości, przy czym Sol osiągnął 97,06% w CTF. W symulacjach zasięgu cybernetycznego Sol wykazał się większym sukcesem niż Luna, przy czym obie stanowiły wyzwania w określonych scenariuszach o wysokim stopniu złożoności. Nie przeprowadzono oceny samodoskonalenia AI, ponieważ GPT-5.6 Sol był już poniżej wysokiego poziomu wydajności. Wdrożone zabezpieczenia mają na celu utrudnianie i wykrywanie zabronionych działań ofensywnych, przy jednoczesnym zachowaniu uzasadnionych obronnych i naukowych zastosowań zdolności w zakresie bezpieczeństwa biologicznego i cybernetycznego, a także wzmacnianiu bezpieczeństwa w Internecie i poza nim.















