ChatGPT는 8월에 개선되었습니다. GPT-5.6은 모든 사람에게 견고성과 보안에 중점을 둡니다.
OpenAI는 8월에 ChatGPT에 대한 일련의 업데이트를 출시하여 더욱 강력한 모델을 도입하고 고급 기능에 대한 액세스를 확대합니다. Free 및 Go 버전 사용자는 이제 일상적인 상호 작용에 새로운 표준 모델을 사용하게 됩니다. Plus 및 Pro 요금제를 구독하는 사람들은 응답 생성 시 ChatGPT의 작업 수준을 조정하는 슬라이더가 포함된 개선된 버전의 GPT-5.6 Sol에 액세스할 수 있습니다. 이 새로운 모델은 GPT-5.5 Instant를 대체하여 사용자 경험이 크게 향상되었습니다.
회사는 준비 프레임워크에 따라 GPT-5.6 Sol 및 GPT-5.6 Luna의 8월 버전이 사이버 보안 및 생물학적, 화학적 인식 측면에서 고용량으로 간주된다고 강조했습니다. 그러나 두 버전 모두 AI 자체 개선의 고용량 임계값에 도달하지 못했습니다. 모델의 보안 평가는 스냅샷 모드와 같은 가장 기본적인 설정에서 수행되어 대부분의 사용 전반에 걸쳐 성능을 파악하는 동시에 기능은 최대한의 추론 노력으로 테스트됩니다.
처음으로 OpenAI에는 18세 미만 사용자를 위한 특정 평가가 포함되었습니다. 이러한 분석은 특히 10대를 위해 만들어진 보안 표준에 따라 모델의 행동을 측정하기 위해 개발되었으며, 이 연령 그룹을 위해 ChatGPT를 더욱 안전하게 만들기 위한 지속적인 노력을 보여줍니다.
모델 및 학습 프로세스에 대한 세부정보
OpenAI에서 개발한 다른 모델과 마찬가지로 GPT-5.6 Sol 및 GPT-5.6 Luna 모델은 방대한 데이터 세트에서 훈련되었습니다. 여기에는 인터넷에서 공개적으로 사용할 수 있는 정보, 제3자와의 파트너십을 통해 얻은 데이터, 사용자, 강사 및 연구원이 제공하거나 생성한 정보가 포함됩니다. 회사는 품질을 보장하고 발생할 수 있는 위험을 줄이기 위해 엄격한 데이터 필터링 프로세스를 사용합니다. 미성년자와 관련된 성적으로 노골적인 자료와 같이 민감하거나 유해한 콘텐츠의 존재를 방지하거나 완화하기 위해 안전 분류자가 사용됩니다.
OpenAI는 이전에 출시된 모델에 대한 비교 값은 이러한 모델의 최신 버전을 참조하기 때문에 처음에 공개된 값과 약간의 차이가 있을 수 있음을 지적합니다. 회사는 GPT-5.6의 사용이 인공지능 기술의 책임 있는 사용을 보장하는 사용 정책, 서비스 약관 및 이용 약관을 준수해야 함을 거듭 강조합니다.
금지된 콘텐츠에 대한 보안 평가
정책 준수를 보장하기 위해 OpenAI는 금지된 콘텐츠의 여러 범주에 대해 벤치마킹을 수행합니다. 이 회사는 실제 사용 데이터에서 도출된 까다로운 대화가 포함된 일련의 분석인 생산 벤치마크를 사용합니다. 이러한 벤치마크는 특히 표준 평가에서 이미 높은 수준의 성과를 보여준 경우 진행 상황을 측정하는 데 도움이 되도록 설계되었습니다. 이러한 평가에서 관찰된 오류율은 평균 프로덕션 트래픽을 반영하는 것이 아니라 시스템 수준 보호 장치 없이 모델 동작에 대한 엄격한 테스트를 반영한 것입니다.
GPT-5.5 Instant June Update에 대해 GPT-5.6 Sol을 평가한 결과, 통계적으로 유의미한 차이가 없는 폭력 및 성적인 콘텐츠를 제외한 모든 금지 카테고리에서 유사한 성능을 보여줍니다. GPT-5.6 Luna의 경우 폭력적인 내용을 제외하면 성능도 비슷한 수준이었습니다. 금지된 성적인 콘텐츠와 관련하여 OpenAI는 노골적인 에로틱한 콘텐츠가 프로덕션 환경에서 사용자에게 도달하는 것을 방지하기 위해 추가 시스템 수준 완화를 구현했습니다. 18세 미만의 경우 연령에 맞는 추가 보호 조치가 적용되어 성적인 콘텐츠와 노골적인 폭력 자료에 대한 노출이 더욱 제한됩니다.

18세 미만 사용자에 대한 보호 및 제한
이 주제 더 보기: 테스트 실패로 인해 OpenAI 인공지능이 Hugging Face 서버에 침입
인공 지능 시스템은 십대들에게 큰 이점을 제공하여 그들이 배우고, 만들고, 문제를 해결하고, 새로운 기술을 개발하도록 돕습니다. OpenAI는 이러한 이점을 극대화하는 동시에 18세 미만 사용자에게 불균형적으로 또는 더 심각한 영향을 미칠 수 있는 잠재적인 피해를 완화하기 위해 시스템을 신중하게 설계합니다. 모델의 동작을 안내하는 원칙 및 요구 사항은 모델 사양에 정의되어 있습니다.
청소년의 경우 안전 정책에 연령별 조항이 구현되어 성적인 내용, 정서적 의존, 섭식 장애, 연령 제한 상품/서비스에 대한 접근 등의 영역에서 성인에게 적용되는 것보다 더 제한적인 제한이 설정됩니다. 이 모델은 낭만적인 역할극을 피하고, 연령 제한이 있는 도전을 장려하거나, 실제 관계를 대체할 수 있도록 훈련되었습니다. 또한 십대에게 지원이 필요할 수 있다는 징후가 식별되면 시스템은 건전한 경계를 강화하고 부모나 교사와 같은 신뢰할 수 있는 성인과의 연결을 장려하도록 설계되었습니다. 시스템 수준 보안 조치는 추가 계층을 추가하여 민감한 콘텐츠에 대한 액세스를 제한하고 사용 중단 기간을 연장하며 부모를 위한 관리 도구를 제공합니다. 18개 미만의 특정 리뷰에서는 연령 제한 제품/서비스 및 성적인 콘텐츠 관련 개선을 포함하여 GPT-5.6 Sol e Luna의 견고한 성능을 보여줍니다.
모델 비전 기능 및 평가
또한 OpenAI는 허용되지 않는 텍스트와 이미지 조합을 고려하여 모델의 “안전하지 않은” 출력을 측정하기 위해 이미지 입력 평가를 수행합니다. 결과는 시력 평가에서 GPT-5.6 Sol의 성능이 GPT-5.5-Instant의 성능과 동일하다는 것을 보여줍니다. GPT-5.6 Luna는 극단주의 평가에서 작은 회귀를 보였으며 통계적 유의성이 낮았으며 이는 전체 용량이 여전히 견고함을 나타냅니다.
사용자 시뮬레이션을 통한 정신 건강 테스트
추가 분석을 위해 회사는 정신 건강, 정서적 의존성 및 자해에 대한 동적 다중 상호 작용 평가를 도입했습니다. 정적 테스트와 달리 이러한 시뮬레이션을 사용하면 모델 출력에 따라 대화가 전개되어 더욱 현실적이고 엄격한 테스트 궤적을 만들 수 있습니다. 이 접근 방식은 장기간의 상호 작용에서 발생할 수 있는 잠재적인 문제를 식별하는 데 도움이 되며 보다 정확한 테스트를 제공합니다.
같은 주제 기사: AI로 범죄 환상 만들어낸 10대, 엄마와 남동생 살해
테스트 결과, 자해 평가에서는 통계적으로 유의미한 회귀가 관찰되었지만 GPT-5.6 Sol은 이러한 평가에서 GPT-5.5 Instant June Update와 광범위하게 비교할 수 있는 것으로 나타났습니다. 그러나 온라인 실험에서는 자해, 정신 건강 및 정서적 의존에 대한 바람직하지 않은 반응의 증가가 기록되지 않았습니다. 회사는 결과를 확인하고 오프라인 테스트와 온라인 테스트 간의 잠재적 불일치를 조사하기 위해 출시 후에도 이러한 측면을 계속 모니터링하고 있습니다.
모델의 견고성 향상
모델의 견고성은 모델의 거부 훈련을 우회하고 유해한 지원을 얻도록 설계된 적대적 자극인 “탈옥”에 대해 테스트됩니다. 이 평가는 생산 시 전체 보호 장치 없이 모델을 직접 잠금 해제하는 데 중점을 둡니다. 이는 보안 조치의 견고성을 강화한 계층입니다. OpenAI는 내부 침입 훈련에서 파생된 정교한 공격 전략을 사용하여 대화 과정에서 조사, 적응 및 확대할 수 있습니다. 높은 공격 예산 시나리오에서 예상되는 변화에도 불구하고 GPT-5.6 Sol 및 GPT-5.6 Luna의 성능은 최근 이전 제품과 비슷한 것으로 간주됩니다.
커넥터에 대한 즉각적인 주입 공격에 대한 저항도 평가됩니다. 이러한 공격은 도구의 출력에 악성 지침을 삽입하여 모델을 속이고 시스템, 개발자 또는 사용자 지침을 덮어씁니다. 검색 및 함수 호출에 초점을 맞춘 이러한 공격의 향상된 버전이 테스트에 포함되었습니다. GPT-5.6 Sol 및 GPT-5.6 Luna 모델은 이번 평가에서 이전 Instant 모델과 동등한 성능을 입증했습니다.
건강 성과 개선
챗봇은 사람들이 자신의 건강을 더 잘 이해할 수 있도록 지원하는 잠재력을 가지고 있습니다. 따라서 새로운 모델은 건강 성과와 안전성을 측정하는 HealthBench와 임상 사용 사례에 중점을 둔 HealthBench Professional에서 평가되었습니다. 인위적으로 점수를 부풀릴 수 있는 긴 응답으로 인해 사용성 및 보안이 손상되는 것을 방지하기 위해 결과는 최종 응답 길이에 맞게 조정됩니다. 짧은 응답은 긍정적인 조정을 받고, 긴 응답은 불이익을 받습니다.
GPT-5.6 Sol 릴리스는 모든 HealthBench 카테고리에서 GPT-5.5 Instant보다 향상된 기능을 제공하며 HealthBench Professional 및 HealthBench Hard에서 상당한 이점을 제공합니다. 일부 범주에서는 응답이 더 짧았고 다른 범주에서는 약간 길었지만 조정된 점수와 조정되지 않은 점수는 전반적으로 향상되었습니다. GPT-5.6 Luna도 작은 크기에도 불구하고 모든 평가에서 개선된 모습을 보였습니다. 이러한 개선을 통해 모든 사용자가 신뢰할 수 있는 건강 정보에 더 폭넓게 접근할 수 있을 것으로 예상됩니다.
자세히 보기: OpenAI AI 모델은 테스트 중에 실수로 Hugging Face 시스템을 해킹했습니다.
환각 감소 및 사실적 정확성 증가
실제로 올바른 답변을 제공하는 모델의 능력을 평가하기 위해 OpenAI는 모델이 환각을 일으킬 가능성이 가장 높은 시나리오를 나타내기 위해 선택된 도전적인 프롬프트 세트에서 사실 환각의 비율을 측정합니다. 이러한 평가는 프로덕션 또는 평균 사용자 경험의 전반적인 확산을 측정하는 대신 어렵고 시간이 지남에 따라 민감한 연구 신호를 제공하도록 설계되었습니다. 시나리오에는 ChatGPT 대화의 사실 중심 프롬프트, 이전 버전의 사용자 보고 충돌, 고위험 의료, 법률 및 재정 상황이 포함됩니다.
결과는 GPT-5.6 Sol 및 GPT-5.6 Luna가 모든 평가에서 GPT-5.5 Instant에 비해 사실 정확도가 크게 향상되었음을 나타냅니다. GPT-5.6 Luna는 고위험 질문에서 사실 오류율을 60% 이상, 다른 두 질문 세트에서는 약 30% 줄일 수 있었습니다. GPT-5.6 Sol은 세 가지 질문 세트 모두에서 사실 오류율을 약 60% 감소시켜 통계적으로 유의미하고 보다 일관된 개선을 보여주었습니다. 이번 개선의 목적은 모델이 제공하는 정보에 대한 사용자의 신뢰도를 높이는 것입니다.
대비 프레임워크 및 보호 장치
OpenAI 준비 프레임워크는 심각한 피해를 초래할 수 있는 엣지 기능을 모니터링하고 준비하기 위한 접근 방식입니다. 이 프레임워크 내에서 회사는 고성능 모델의 위험을 충분히 최소화하는 안전 장치를 구현하여 이러한 위험을 완화하기 위해 노력합니다. 업데이트된 GPT-5.6 Sol 및 GPT-5.6 Luna 모델은 이전에 출시된 GPT-5.6 모델과 동일한 준비 프레임워크 등급(생물학적 및 화학적 보안이 높음, 사이버 보안이 높음, AI 자체 개선이 높음)을 보장합니다.
추가 단서, 미세 조정 또는 혁신적인 상호 작용이 테스트에서 관찰된 것 이상의 동작을 유도할 수 있으므로 기능 평가는 잠재적 기능의 하한을 나타냅니다. 생물학적 및 화학적 영역에서 “고성능”은 알려진 심각한 위협을 생성하는 “초보” 행위자에게 모델이 제공할 수 있는 중요한 지원으로 정의됩니다. 바이러스학 및 암묵적 지식에 대한 테스트에서는 업데이트된 모델이 일부 영역에서는 전문가 기준을 초과했지만 실험실 프로토콜 문제 해결 능력과 같은 다른 영역에서는 부족한 것으로 나타났습니다.
사이버 보안에서 “고용량”은 합리적으로 보호되는 대상 또는 취약점 발견/이용에 대해 엔드투엔드 사이버 운영을 자동화하는 모델로 정의됩니다. CTF(Capture the Flag) 및 CVE-Bench 챌린지 테스트에 따르면 GPT-5.6 Sol과 Luna는 일부 시나리오에서 높은 준비 상태 임계값을 초과했으며 Sol은 CTF에서 97.06%를 달성했습니다. 사이버 범위 시뮬레이션에서 Sol은 Luna보다 더 큰 성공을 보였으며 둘 다 특정 복잡도가 높은 시나리오에서 과제를 제시했습니다. GPT-5.6 Sol은 이미 고용량 수준보다 낮았기 때문에 AI 자체 개선 평가는 수행되지 않았습니다. 구현된 보호 조치는 금지된 공격 활동을 방해하고 탐지하는 동시에 생물학적 및 사이버 보안 기능의 합법적인 방어 및 과학적 사용을 유지하고 온라인 및 오프라인 보안을 강화하는 것을 목표로 합니다.















