ChatGPT は 8 月に改善されます: GPT-5.6 は堅牢性とセキュリティへの重点をすべての人にもたらします
OpenAI は 8 月に ChatGPT の一連のアップデートをリリースし、より強力なモデルを導入し、高度な機能へのアクセスを拡大します。 Free バージョンと Go バージョンのユーザーは、日々のやり取りに新しい標準モデルを使用するようになります。 Plus および Pro プランに加入している人は、応答を生成する際の ChatGPT の作業レベルを調整するスライダーを含む、GPT-5.6 Sol の改良版にアクセスできます。これらの新しいモデルは GPT-5.5 Instant に代わるもので、ユーザー エクスペリエンスが大幅に向上しました。
同社は、準備フレームワークによれば、GPT-5.6 Sol と GPT-5.6 Luna の 8 月バージョンはサイバーセキュリティと生物学的および化学的認識の点で高機能であると考えられると強調しました。ただし、どちらのバージョンも、AI の自己改善における高い能力の基準には達していません。モデルのセキュリティ評価は、スナップショット モードなどの最も基本的な設定で実行され、ほとんどの用途でのパフォーマンスを把握する一方、機能は最大の推論努力でテストされます。
OpenAI には初めて、18 歳未満のユーザーに対する特定の評価が含まれています。これらの分析は、特に 10 代向けに作成されたセキュリティ標準に対するモデルの動作を測定するために開発されており、この年齢層にとって ChatGPT をより安全にするための継続的な取り組みを示しています。
モデルとトレーニングプロセスの詳細
GPT-5.6 Sol モデルと GPT-5.6 Luna モデルは、OpenAI によって開発された他のモデルと同様、膨大なデータセットでトレーニングされました。これには、インターネット上で公開されている情報、第三者とのパートナーシップを通じて取得したデータ、ユーザー、トレーナー、研究者によって提供または生成された情報が含まれます。同社は、品質を確保し、起こり得るリスクを軽減するために、厳格なデータ フィルタリング プロセスを使用しています。安全分類子は、未成年者が関与する露骨な性的コンテンツなど、デリケートなコンテンツや有害なコンテンツの存在を防止または軽減するために使用されます。
OpenAIは、以前にリリースされたモデルの比較値は、これらのモデルの最新バージョンを参照しているため、最初に公開された値と比較してわずかな変動がある可能性があると指摘しています。同社は、GPT-5.6 の使用は、人工知能テクノロジーの責任ある使用を保証する使用ポリシー、利用規約、利用規約に従わなければならないことを繰り返し述べています。
禁止されたコンテンツのセキュリティ評価
ポリシーへの準拠を保証するために、OpenAI は、禁止されているコンテンツのいくつかのカテゴリにわたってベンチマークを実行します。同社は、実世界の使用状況データから抽出された困難な会話を含む一連の分析であるプロダクション ベンチマークを使用しています。これらのベンチマークは、特に標準的な評価ですでに高いレベルのパフォーマンスが示されている場合に、難しくても進捗状況を測定できるように設計されています。これらの評価で観察されたエラー率は、実稼働トラフィックの平均を反映するものではなく、システム レベルの安全対策なしでのモデルの動作の厳密なテストを反映しています。
GPT-5.6 Sol を GPT-5.5 インスタント 6 月アップデートと比較して評価すると、統計的に有意な差がなかった暴力コンテンツと性的コンテンツを除き、すべての禁止カテゴリで同様のパフォーマンスが得られました。 GPT-5.6 Luna の場合も、暴力的なコンテンツを除いてパフォーマンスは同等でした。禁止されている性的コンテンツに関して、OpenAI は、露骨なエロティックなコンテンツが本番環境でユーザーに到達するのを防ぐために、追加のシステム レベルの緩和策を実装しました。 18 歳未満のユーザーに対しては、年齢に応じた追加の保護が適用され、性的コンテンツや暴力的な描写への露出がさらに制限されています。

18 歳未満のユーザーに対する保護と制限
人工知能システムは、十代の若者たちに大きなメリットをもたらし、学習、創造、問題解決、新しいスキルの開発を支援します。 OpenAI は、18 歳未満のユーザーに不釣り合いまたはより深刻な影響を与える可能性のある潜在的な害を軽減しながら、これらの利点を最大化するようにシステムを慎重に設計しています。モデルの動作をガイドする原則と要件は、モデル仕様で定義されています。
詳しく読む: WhatsApp ステッカーを作成およびエクスポートするための ChatGPT テスト機能
ティーンエイジャーに対しては、安全政策に年齢別の規定が導入されており、性的コンテンツ、精神的依存、摂食障害、年齢制限のある商品やサービスへのアクセスなどの分野において、成人に適用されるものよりも厳しい制限が設けられています。モデルは、ロマンチックなロールプレイを避けたり、年齢制限のある挑戦を奨励したり、実際の関係の代替として自分自身を位置づけたりすることを避けるように訓練されています。さらに、このシステムは、十代の若者がサポートを必要とする兆候を特定した場合、健全な境界線を強化し、親や教師などの信頼できる大人とのつながりを促すように設計されています。システムレベルのセキュリティ対策により追加のレイヤーが追加され、機密コンテンツへのアクセスが制限され、長時間の使用中止が奨励され、保護者向けの管理ツールが提供されます。 18 歳未満の特定のレビューでは、年齢制限のある製品/サービスや性的コンテンツに関する改善など、GPT-5.6 Sol e Luna の確かなパフォーマンスが実証されています。
モデルのビジョン機能と評価
OpenAI はまた、画像入力評価を実行して、許可されていないテキストと画像の組み合わせを考慮して、モデルの「not_unsafe」出力を測定します。結果は、視力評価における GPT-5.6 Sol のパフォーマンスが GPT-5.5-Instant のパフォーマンスと同等であることを示しています。一方、GPT-5.6 Luna は、統計的有意性が低く、過激主義の評価においてわずかな後退を示し、全体的な容量が引き続き堅調であることを示しています。
ユーザーシミュレーションによるメンタルヘルステスト
さらなる分析のために、同社はメンタルヘルス、感情的依存、自傷行為に関する動的なマルチインタラクション評価を導入しました。静的テストとは異なり、これらのシミュレーションでは、モデルの出力に応じて会話を発展させ、より現実的で厳密なテスト軌道を作成できます。このアプローチは、長時間のやり取りで発生する可能性のある潜在的な問題を特定するのに役立ち、より正確なテストを提供します。
テストの結果、自傷行為の評価では統計的に有意な後退が観察されましたが、GPT-5.6 Sol はこれらの評価において GPT-5.5 Instant June Update とほぼ同等であることが明らかになりました。しかし、オンライン実験では、自傷行為、メンタルヘルス、感情的依存に対する望ましくない反応の増加は記録されませんでした。同社は、結果を検証し、オフライン テストとオンライン テストの間の潜在的な差異を調査するために、発売後もこれらの側面を監視し続けています。
この話題の続き: AIを使用して犯罪に関する空想を作り出した後、ティーンエイジャーが母親と弟を殺害
モデルの堅牢性の向上
モデルの堅牢性は、モデルの拒否トレーニングを回避して有害な支援を得るように設計された敵対的刺激である「脱獄」に対してテストされます。この評価は、運用環境での完全な保護手段を使用せずに、モデルを直接ロック解除することに焦点を当てています。セキュリティ対策における堅牢性の層です。 OpenAI は、内部侵入演習から派生した高度な攻撃戦略を使用しており、会話中に調査、適応、エスカレーションすることができます。高い攻撃予算のシナリオでは変動が予想されるにもかかわらず、GPT-5.6 Sol と GPT-5.6 Luna のパフォーマンスは、最近の前任者と同等であると考えられています。
コネクタに対する即時インジェクション攻撃に対する耐性も評価されます。これらの攻撃は、ツールの出力に悪意のある命令を挿入してモデルを騙し、システム、開発者、またはユーザーの命令を上書きします。検索と関数呼び出しに焦点を当てた、これらの攻撃の改良版がテストに含まれていました。 GPT-5.6 Sol および GPT-5.6 Luna モデルは、これらの評価において以前の Instant モデルと同等のパフォーマンスを実証しました。
健康パフォーマンスの向上
チャットボットには、人々が自分の健康状態をより深く理解できるようになる可能性があります。したがって、新しいモデルは、健康パフォーマンスと安全性を測定する HealthBench と、臨床使用例に焦点を当てた HealthBench Professional で評価されました。スコアが人為的に膨らむ可能性のある長い応答によってユーザビリティとセキュリティが損なわれるのを防ぐために、結果は最終的な応答の長さに合わせて調整されます。短い応答にはプラスの調整が加えられますが、長い応答にはペナルティが課されます。
同じテーマの記事: OpenAI が無料の ChatGPT アカウントで無制限のテキスト会話をロック解除します
GPT-5.6 Sol リリースでは、すべての HealthBench カテゴリにわたって GPT-5.5 Instant よりも改良が加えられ、HealthBench Professional と HealthBench Hard で大幅な改善が行われています。一部のカテゴリーでは回答が短くなり、他のカテゴリーではわずかに長くなりましたが、調整済みおよび未調整のスコアは全体的に改善されました。 GPT-5.6 Luna も、サイズが小さくなったにもかかわらず、すべての評価で改善を示しました。これらの改善により、すべてのユーザーが信頼できる健康情報に幅広くアクセスできるようになることが期待されます。
幻覚が減り、事実の正確さが増す
事実に基づいて正しい答えを提供するモデルの能力を評価するために、OpenAI は、モデルが幻覚を起こす可能性が最も高いシナリオを表すために選択された一連の挑戦的なプロンプトにおける事実に基づく幻覚の割合を測定します。これらの評価は、実稼働環境や平均的なユーザー エクスペリエンスにおける全体的な普及率を測定するのではなく、難しく、長期にわたって機密性の高い調査シグナルを提供するように設計されています。シナリオには、ChatGPT の会話からの事実に焦点を当てたプロンプト、以前のバージョンでユーザーが報告したクラッシュ、リスクの高い医療、法律、財務状況が含まれます。
結果は、GPT-5.6 Sol および GPT-5.6 Luna が、すべての評価において GPT-5.5 Instant と比較して事実の精度が大幅に向上していることを示しています。 GPT-5.6 Luna は、一か八かの質問で事実誤認率を 60% 以上、他の 2 つの質問セットで約 30% 削減することができました。 GPT-5.6 Sol は、統計的に有意でより一貫した改善を示し、3 つの質問セットすべてで事実誤認率を約 60% 削減しました。この改善は、モデルが提供する情報に対するユーザーの信頼性を高めることを目的としています。
準備の枠組みと安全対策
OpenAI Preparedness Framework は、深刻な危害をもたらすリスクを引き起こす可能性のあるエッジ機能を監視し、準備するためのアプローチです。この枠組みの中で、同社は高機能モデルの危険性を十分に最小限に抑える安全策を導入することで、これらのリスクを軽減するよう取り組んでいます。更新された GPT-5.6 Sol および GPT-5.6 Luna モデルは、以前にリリースされた GPT-5.6 モデルと同じ Readiness Framework 評価 (生物学的および化学的セキュリティで高、サイバーセキュリティで高、AI 自己改善で高以下) を保証します。
この話題の続き: OpenAI が新しい Astra モデルと人工知能推論の進歩を発表
追加の手がかり、微調整、または革新的なインタラクションによって、テストで観察されたものを超える動作が誘発される可能性があるため、能力評価は潜在的な能力の下限を表します。生物学および化学の領域では、「高い能力」は、既知の深刻な脅威を作成する際にモデルが「初心者」の攻撃者に提供できる重要な支援によって定義されます。ウイルス学と暗黙知のテストでは、更新されたモデルが一部の領域では専門家の閾値を上回ったものの、実験室プロトコルのトラブルシューティング能力など他の領域では下回っていることが示されました。
サイバーセキュリティにおける「大容量」は、合理的に保護されたターゲットや脆弱性の発見/悪用に対するエンドツーエンドのサイバー運用を自動化するモデルによって定義されます。キャプチャ ザ フラッグ (CTF) および CVE-Bench チャレンジのテストでは、GPT-5.6 Sol と Luna が一部のシナリオで高い準備閾値を超え、Sol が CTF で 97.06% を達成したことが示されました。サイバー レンジ シミュレーションでは、Sol が Luna よりも大きな成功を収めましたが、どちらも特定の高複雑なシナリオで課題を提示しました。 GPT-5.6 Sol がすでに高容量レベルを下回っていたため、AI の自己改善評価は実行されませんでした。実装されたセーフガードは、生物学的およびサイバーセキュリティ能力の正当な防御的および科学的使用を維持しながら、オンラインおよびオフラインのセキュリティを強化しながら、禁止されている攻撃的活動を阻止および検出することを目的としています。














