W sierpniu ChatGPT otrzyma ulepszenia: GPT-5.6 zapewnia wszystkim niezawodność i bezpieczeństwo

OpenAI ChatGPT
Foto: OpenAI ChatGPT - Foto: One Artist / Shutterstock.com

OpenAI wypuści w sierpniu serię aktualizacji ChatGPT, wprowadzających potężniejsze modele i rozszerzających dostęp do zaawansowanych funkcji. Użytkownicy wersji Free i Go będą teraz korzystać z nowego standardowego modelu codziennych interakcji. Ci, którzy subskrybują plany Plus i Pro, będą mieli dostęp do ulepszonej wersji GPT-5.6 Sol, która zawiera suwak umożliwiający dostosowanie poziomu wysiłku ChatGPT podczas generowania odpowiedzi. Te nowe modele zastępują GPT-5.5 Instant, co oznacza znaczny postęp w zakresie komfortu użytkowania.

Firma podkreśliła, że ​​zgodnie z ramami przygotowawczymi sierpniowe wersje GPT-5.6 Sol i GPT-5.6 Luna są uważane za charakteryzujące się dużą wydajnością pod względem cyberbezpieczeństwa oraz rozpoznawania biologicznego i chemicznego. Żadna wersja nie osiągnęła jednak progu dużych możliwości samodoskonalenia AI. Ocena bezpieczeństwa modeli jest przeprowadzana przy ich najbardziej podstawowych ustawieniach, takich jak tryb migawki, aby uchwycić wydajność w większości zastosowań, podczas gdy możliwości są testowane przy maksymalnym wysiłku wnioskowania.

Po raz pierwszy OpenAI uwzględniło szczegółowe oceny użytkowników poniżej 18 roku życia. Analityki te opracowano w celu pomiaru zachowań modeli w odniesieniu do standardów bezpieczeństwa stworzonych specjalnie dla nastolatków, co świadczy o ciągłych wysiłkach mających na celu uczynienie ChatGPT bezpieczniejszym dla tej grupy wiekowej.

Szczegóły dotyczące modeli i procesu uczenia

Modele GPT-5.6 Sol i GPT-5.6 Luna, podobnie jak inne opracowane przez OpenAI, zostały przeszkolone na ogromnych zbiorach danych. Obejmuje to informacje publicznie dostępne w Internecie, dane uzyskane w ramach partnerstwa ze stronami trzecimi oraz informacje dostarczone lub wygenerowane przez użytkowników, trenerów i badaczy. Firma stosuje rygorystyczny proces filtrowania danych, aby zapewnić jakość i ograniczyć ewentualne ryzyko. Klasyfikatory bezpieczeństwa służą do zapobiegania lub ograniczania obecności wrażliwych lub szkodliwych treści, takich jak materiały o charakterze jednoznacznie seksualnym z udziałem nieletnich.

OpenAI zwraca uwagę, że wartości porównawcze dla wcześniej wydanych modeli mogą wykazywać niewielkie różnice w stosunku do wartości pierwotnie opublikowanych, gdyż odnoszą się one do najnowszych wersji tych modeli. Firma powtarza, że ​​korzystanie z GPT-5.6 musi być zgodne z Polityką użytkowania, Warunkami świadczenia usług i Warunkami użytkowania, które gwarantują odpowiedzialne korzystanie z technologii sztucznej inteligencji.

Oceny bezpieczeństwa dotyczące zabronionych treści

Aby zapewnić zgodność ze swoimi zasadami, OpenAI przeprowadza testy porównawcze kilku kategorii zabronionych treści. Firma korzysta z testów porównawczych produkcji, zestawu analiz obejmujących trudne rozmowy zaczerpnięte z rzeczywistych danych o użytkowaniu. Te punkty odniesienia zostały zaprojektowane tak, aby były trudne i pomagały mierzyć postęp, zwłaszcza tam, gdzie standardowe oceny wykazały już wysoki poziom wyników. Poziomy błędów zaobserwowane w tych ocenach nie odzwierciedlają średniego ruchu produkcyjnego, ale raczej rygorystyczny test zachowania modelu bez zabezpieczeń na poziomie systemu.

Porównując GPT-5.6 Sol z natychmiastową czerwcową aktualizacją GPT-5.5, wyniki pokazują podobną skuteczność we wszystkich zabronionych kategoriach, z wyjątkiem treści zawierających przemoc i seksualność, gdzie nie było statystycznie istotnej różnicy. W przypadku GPT-5.6 Luna wydajność była również porównywalna, z wyjątkiem treści zawierających przemoc. Jeśli chodzi o zabronione treści o charakterze seksualnym, OpenAI wdrożyło dodatkowe środki zaradcze na poziomie systemu, aby zapobiec dotarciu materiałów erotycznych do użytkowników w fazie produkcyjnej. W przypadku osób poniżej 18 roku życia zastosowano dodatkowe zabezpieczenia odpowiednie do wieku, jeszcze bardziej ograniczając treści o charakterze seksualnym i narażenie na drastyczne materiały przedstawiające przemoc.

Logo ChatGPT
Logo ChatGPT – Markus Mainka/ Shutterstock.com

Zabezpieczenia i ograniczenia dla użytkowników poniżej 18 roku życia

Systemy sztucznej inteligencji mogą zaoferować nastolatkom ogromne korzyści, pomagając im uczyć się, tworzyć, rozwiązywać problemy i rozwijać nowe umiejętności. OpenAI starannie projektuje swoje systemy, aby zmaksymalizować te korzyści, jednocześnie łagodząc potencjalne szkody, które mogą nieproporcjonalnie lub bardziej dotkliwie dotknąć użytkowników poniżej 18 roku życia. Zasady i wymagania, które kierują zachowaniem modeli, są określone w Specyfikacji Modelu.

W przypadku nastolatków do polityk bezpieczeństwa wprowadzono przepisy dotyczące wieku, ustanawiające bardziej restrykcyjne limity niż te stosowane w przypadku dorosłych w takich obszarach, jak treści o charakterze seksualnym, uzależnienie emocjonalne, zaburzenia odżywiania i dostęp do towarów/usług objętych ograniczeniami wiekowymi. Modelka jest szkolona, ​​aby unikać romantycznego odgrywania ról, zachęcać do wyzwań związanych z wiekiem lub pozycjonować się jako substytut prawdziwych związków. Ponadto, gdy zidentyfikuje oznaki, że nastolatek może potrzebować wsparcia, system ma za zadanie wzmacniać zdrowe granice i zachęcać do kontaktu z zaufanymi dorosłymi, takimi jak rodzice czy nauczyciele. Środki bezpieczeństwa na poziomie systemu dodają dodatkową warstwę, ograniczając dostęp do poufnych treści, zachęcając do dłuższych przerw w użytkowaniu i zapewniając rodzicom narzędzia do zarządzania. Poniżej 18 konkretnych recenzji wykazuje solidne działanie GPT-5.6 Sol e Luna, w tym ulepszenia dotyczące produktów/usług z ograniczeniami wiekowymi i treści seksualnych.

Modelowanie możliwości i ocen wizji

OpenAI przeprowadza również ocenę danych wejściowych obrazu, aby zmierzyć wynik „not_unsafe” modelu, biorąc pod uwagę niedozwolone kombinacje tekstu i obrazu. Wyniki pokazują, że skuteczność GPT-5.6 Sol w ocenie wzroku jest porównywalna z wydajnością GPT-5.5-Instant. Z kolei GPT-5.6 Luna wykazała niewielki regres w ocenie ekstremizmu, o niskiej istotności statystycznej, co wskazuje, że ogólna pojemność pozostaje solidna.

Testy zdrowia psychicznego z symulacjami użytkownika

Do dalszej analizy firma wprowadziła dynamiczne, wielointerakcyjne oceny zdrowia psychicznego, uzależnienia emocjonalnego i samookaleczeń. W przeciwieństwie do testów statycznych, symulacje te umożliwiają ewolucję rozmów w odpowiedzi na wyniki modelu, tworząc bardziej realistyczne i rygorystyczne trajektorie testów. Takie podejście pomaga zidentyfikować potencjalne problemy, które mogą pojawić się w wyniku długotrwałych interakcji, zapewniając dokładniejszy test.

Testy wykazały, że w tych ocenach GPT-5.6 Sol jest zasadniczo porównywalny z natychmiastową czerwcową aktualizacją GPT-5.5, chociaż zaobserwowano statystycznie istotny regres w ocenie samookaleczeń. Jednak podczas eksperymentu internetowego nie odnotowano wzrostu niepożądanych reakcji na samookaleczenie, zdrowie psychiczne i uzależnienie emocjonalne. Firma w dalszym ciągu monitoruje te aspekty po wprowadzeniu na rynek, aby zweryfikować wyniki i zbadać potencjalne rozbieżności między testami offline i online.

Poprawa wytrzymałości modeli

Odporność modelu jest testowana pod kątem „ucieczek z więzienia”, czyli bodźców kontradyktoryjnych mających na celu ominięcie szkolenia modela w zakresie odmowy i uzyskanie szkodliwej pomocy. Ocena ta koncentruje się na bezpośrednim odblokowaniu modelu, bez pełnego zestawu zabezpieczeń w produkcji. Jest to warstwa solidności środków bezpieczeństwa. OpenAI wykorzystuje wyrafinowane strategie ataków wywodzące się z wewnętrznych ćwiczeń w zakresie włamań, które mogą sondować, dostosowywać się i eskalować w trakcie rozmowy. Pomimo oczekiwanych różnic w scenariuszach wysokiego budżetu na ataki, wydajność GPT-5.6 Sol i GPT-5.6 Luna uważa się za porównywalną z ich najnowszymi poprzednikami.

Oceniana jest także odporność na natychmiastowe ataki wtryskowe na złącza. Ataki te polegają na wstawianiu złośliwych instrukcji do danych wyjściowych narzędzia w celu oszukania modelu i nadpisania instrukcji systemowych, programistycznych lub użytkownika. W testach uwzględniono ulepszone wersje tych ataków, skupiające się na wyszukiwaniu i wywoływaniu funkcji. W tych ocenach modele GPT-5.6 Sol i GPT-5.6 Luna wykazały porównywalną wydajność z poprzednimi modelami Instant.

Poprawa wyników zdrowotnych

Chatboty mogą pomóc ludziom lepiej zrozumieć swoje zdrowie. Dlatego też nowe modele zostały poddane ocenie w HealthBench, który mierzy stan zdrowia i bezpieczeństwo, oraz w HealthBench Professional, skupiającym się na zastosowaniach klinicznych. Aby dłuższe odpowiedzi, które mogą sztucznie zawyżać wyniki, nie szkodziły użyteczności i bezpieczeństwu, wyniki są dostosowywane do ostatecznej długości odpowiedzi. Krótsze odpowiedzi podlegają pozytywnej korekcie, natomiast dłuższe są karane.

Wersja GPT-5.6 Sol zapewnia ulepszenia w porównaniu z GPT-5.5 Instant we wszystkich kategoriach HealthBench, ze znacznymi korzyściami w HealthBench Professional i HealthBench Hard. Odpowiedzi były krótsze w niektórych kategoriach i nieco dłuższe w innych, ale ogólnie poprawiły się wyniki skorygowane i nieskorygowane. GPT-5.6 Luna również wykazała poprawę we wszystkich ocenach pomimo mniejszych rozmiarów. Oczekuje się, że te ulepszenia zaowocują szerszym dostępem do wiarygodnych informacji zdrowotnych dla wszystkich użytkowników.

Zmniejszone halucynacje i zwiększona dokładność faktów

Aby ocenić zdolność modeli do udzielania zgodnych z faktami odpowiedzi, OpenAI mierzy częstość występowania halucynacji opartych na faktach w zestawach trudnych podpowiedzi wybranych tak, aby reprezentowały scenariusze, w których model najprawdopodobniej będzie miał halucynacje. Oceny te mają być trudne i zapewniać wrażliwy sygnał badawczy w miarę upływu czasu, a nie mierzyć ogólną częstość występowania w produkcji lub przeciętne doświadczenie użytkownika. Scenariusze obejmują oparte na faktach podpowiedzi z rozmów ChatGPT, awarie zgłaszane przez użytkowników w poprzednich wersjach oraz sytuacje medyczne, prawne i finansowe wysokiego ryzyka.

Wyniki wskazują, że GPT-5.6 Sol i GPT-5.6 Luna wykazują znaczną poprawę dokładności faktów w porównaniu do GPT-5.5 Instant we wszystkich ocenach. GPT-5.6 Luna była w stanie zmniejszyć liczbę błędów rzeczowych o ponad 60% w przypadku pytań o wysoką stawkę i około 30% w przypadku pozostałych dwóch zestawów pytań. GPT-5.6 Sol wykazał statystycznie znaczącą i bardziej spójną poprawę, zmniejszając poziom błędów faktycznych o około 60% we wszystkich trzech zestawach pytań. To ulepszenie ma na celu zwiększenie zaufania użytkowników do informacji dostarczanych przez modele.

Ramy gotowości i zabezpieczenia

Ramy gotowości OpenAI to podejście do monitorowania i przygotowywania się na możliwości brzegowe, które mogą stwarzać ryzyko poważnych szkód. W tym kontekście firma pracuje nad ograniczeniem tego ryzyka poprzez wdrożenie zabezpieczeń, które w wystarczającym stopniu minimalizują zagrożenia w przypadku modeli o dużych możliwościach. Zaktualizowane modele GPT-5.6 Sol i GPT-5.6 Luna gwarantują te same oceny w ramach programu gotowości, co poprzednio wydane modele GPT-5.6: wysoki poziom bezpieczeństwa biologicznego i chemicznego, wysoki poziom cyberbezpieczeństwa i niższy poziom samodoskonalenia AI.

Oceny zdolności stanowią dolną granicę potencjalnych możliwości, ponieważ dodatkowe wskazówki, dostrajanie lub innowacyjne interakcje mogą wywołać zachowania wykraczające poza to, co zaobserwowano w testach. W dziedzinach biologicznych i chemicznych „wysoką zdolność” definiuje się jako znaczącą pomoc, jaką modele mogą zapewnić „nowicjuszom” podmiotom w tworzeniu znanych poważnych zagrożeń. Testy z zakresu wirusologii i wiedzy ukrytej wykazały, że zaktualizowane modele w niektórych obszarach przekroczyły progi ekspertów, a w innych odpadły, np. zdolność rozwiązywania problemów z protokołami laboratoryjnymi.

W cyberbezpieczeństwie „dużą pojemność” definiuje się przez modele, które automatyzują kompleksowe operacje cybernetyczne przeciwko odpowiednio chronionym celom lub odkrywaniu/wykorzystywaniu luk w zabezpieczeniach. Testy w ramach wyzwań Capture the Flag (CTF) i CVE-Bench wykazały, że GPT-5.6 Sol i Luna przekroczyły w niektórych scenariuszach wysoki próg gotowości, przy czym Sol osiągnął 97,06% w CTF. W symulacjach zasięgu cybernetycznego Sol wykazał się większym sukcesem niż Luna, przy czym obie stanowiły wyzwania w określonych scenariuszach o wysokim stopniu złożoności. Nie przeprowadzono oceny samodoskonalenia AI, ponieważ GPT-5.6 Sol był już poniżej wysokiego poziomu wydajności. Wdrożone zabezpieczenia mają na celu utrudnianie i wykrywanie zabronionych działań ofensywnych, przy jednoczesnym zachowaniu uzasadnionych obronnych i naukowych zastosowań zdolności w zakresie bezpieczeństwa biologicznego i cybernetycznego, a także wzmacnianiu bezpieczeństwa w Internecie i poza nim.

Zobacz Też Najnowsze Wiadomości (PL)

Abonamenty na usługi Xbox stają się tańsze po zmianie strategii
Najnowsze Wiadomości (PL) • 13/08/2026

Abonamenty na usługi Xbox stają się tańsze po zmianie strategii

Posiadacze PS5 zyskują stały dostęp do dwóch głównych tytułów w wirtualnym sklepie
Najnowsze Wiadomości (PL) • 13/08/2026

Posiadacze PS5 zyskują stały dostęp do dwóch głównych tytułów w wirtualnym sklepie

W 2026 roku Epic Games Store udostępni bezpłatnie na PC 12 znanych gier
Najnowsze Wiadomości (PL) • 13/08/2026

W 2026 roku Epic Games Store udostępni bezpłatnie na PC 12 znanych gier

Nastolatek zabija matkę i brata po użyciu sztucznej inteligencji do tworzenia fantazji na temat przestępstwa
Najnowsze Wiadomości (PL) • 13/08/2026

Nastolatek zabija matkę i brata po użyciu sztucznej inteligencji do tworzenia fantazji na temat przestępstwa

Abonament samochodowy się opłaca w 2026 roku? Zobacz porównanie z zakupem
Najnowsze Wiadomości (PL) • 13/08/2026

Abonament samochodowy się opłaca w 2026 roku? Zobacz porównanie z zakupem

Międzygwiazdowa kometa 3I/ATLAS podróżuje z prędkością 58 km/s, a Jowisz zmieni jej trasę
Najnowsze Wiadomości (PL) • 13/08/2026

Międzygwiazdowa kometa 3I/ATLAS podróżuje z prędkością 58 km/s, a Jowisz zmieni jej trasę

Toyota ogłasza globalną akcję wycofania 655 000 egzemplarzy Camry z powodu awarii deski rozdzielczej
Najnowsze Wiadomości (PL) • 13/08/2026

Toyota ogłasza globalną akcję wycofania 655 000 egzemplarzy Camry z powodu awarii deski rozdzielczej

Prichard Colón, były bokser, umiera w wieku 33 lat po 11 latach walki z uszkodzeniem mózgu
Najnowsze Wiadomości (PL) • 13/08/2026

Prichard Colón, były bokser, umiera w wieku 33 lat po 11 latach walki z uszkodzeniem mózgu

Zablokuj skradziony telefon komórkowy: podstawowe kroki, aby chronić swoje dane i śledzić urządzenie
Najnowsze Wiadomości (PL) • 13/08/2026

Zablokuj skradziony telefon komórkowy: podstawowe kroki, aby chronić swoje dane i śledzić urządzenie

Google wprowadza serię Pixel 11 z ulepszonym chipem Tensor G6 i nowym Pixel Tag
Najnowsze Wiadomości (PL) • 13/08/2026

Google wprowadza serię Pixel 11 z ulepszonym chipem Tensor G6 i nowym Pixel Tag

Powolne ładowanie Galaxy Watch 9 i Ultra 2 zmusza użytkowników do wykonywania takich sztuczek, jak wentylator i lód
Najnowsze Wiadomości (PL) • 13/08/2026

Powolne ładowanie Galaxy Watch 9 i Ultra 2 zmusza użytkowników do wykonywania takich sztuczek, jak wentylator i lód

Nieoczekiwane pojawienie się Everspace 2: Galactic Edition wzbogaca katalog Nintendo Switch 2
Najnowsze Wiadomości (PL) • 13/08/2026

Nieoczekiwane pojawienie się Everspace 2: Galactic Edition wzbogaca katalog Nintendo Switch 2

Teleskop Webba należący do NASA odkrywa nową gigantyczną planetę innowacyjną metodą
Najnowsze Wiadomości (PL) • 13/08/2026

Teleskop Webba należący do NASA odkrywa nową gigantyczną planetę innowacyjną metodą

POCO X8 zbliża się do premiery z baterią 9000 mAh i ekranem o wysokiej rozdzielczości
Najnowsze Wiadomości (PL) • 13/08/2026

POCO X8 zbliża się do premiery z baterią 9000 mAh i ekranem o wysokiej rozdzielczości

Rakieta SpaceX zderza się z Księżycem w ramach zdarzenia monitorowanego przez NASA, co eliminuje ryzyko dla Ziemi
Najnowsze Wiadomości (PL) • 13/08/2026

Rakieta SpaceX zderza się z Księżycem w ramach zdarzenia monitorowanego przez NASA, co eliminuje ryzyko dla Ziemi