ChatGPT 在 8 月獲得改進:GPT-5.6 為每個人帶來穩健性和安全性
OpenAI 將於 8 月發布 ChatGPT 的一系列更新,引入更強大的模型並擴展對高級功能的存取。 Free 和 Go 版本的使用者現在將使用新的標準模型進行日常互動。訂閱 Plus 和 Pro 計劃的用戶將可以使用 GPT-5.6 Sol 的改進版本,其中包括一個滑桿,用於在產生回應時調整 ChatGPT 的努力程度。這些新型號取代了GPT-5.5 Instant,標誌著用戶體驗的顯著進步。
該公司強調,根據其準備框架,8 月份版本的 GPT-5.6 Sol 和 GPT-5.6 Luna 在網路安全和生物和化學識別方面被認為具有高能力。然而,這兩個版本都沒有達到人工智慧自我改進的高能力門檻。模型的安全評估是在最基本的設定(例如快照模式)下執行的,以捕捉大多數用途的性能,同時以最大的推理努力來測試功能。
OpenAI 首次納入了針對 18 歲以下使用者的具體評估。這些分析是為了根據專門為青少年創建的安全標準來衡量模型的行為,表明我們正在努力讓 ChatGPT 對於這個年齡層的人更安全。
有關模型和訓練過程的詳細信息
GPT-5.6 Sol 和 GPT-5.6 Luna 模型與 OpenAI 開發的其他模型一樣,都是在大量資料集上進行訓練的。這包括網路上公開提供的資訊、透過與第三方合作獲得的數據以及使用者、培訓師和研究人員提供或產生的資訊。本公司採用嚴格的資料過濾流程來確保品質並降低可能的風險。安全分類器用於防止或減少敏感或有害內容的出現,例如涉及未成年人的露骨色情材料。
OpenAI 指出,先前發布的模型的比較值可能與最初發布的值相比存在微小變化,因為它們指的是這些模型的最新版本。該公司重申,GPT-5.6的使用必須遵守其使用政策、服務條款和使用條款,以確保負責任地使用人工智慧技術。
對禁止內容的安全評估
為了確保遵守其政策,OpenAI 對多個類別的禁止內容進行基準測試。該公司使用生產基準,這是一組分析,其中包括從現實世界使用數據中提取的具有挑戰性的對話。這些基準被設計得很困難,有助於衡量進展,特別是在標準評估已經顯示出高水準績效的情況下。這些評估中觀察到的錯誤率並不反映平均生產流量,而是在沒有系統層級保護措施的情況下對模型行為的嚴格測試。
更多相關報導: 青少年使用人工智慧創造犯罪幻想後殺死了母親和兄弟
將 GPT-5.6 Sol 與 GPT-5.5 即時六月更新進行評估,結果顯示在所有禁止類別中的表現相似,但暴力和色情內容除外,沒有統計上的顯著差異。對於 GPT-5.6 Luna,除了暴力內容外,表現也相當。關於禁止的色情內容,OpenAI 實施了額外的系統級緩解措施,以防止露骨的色情內容到達生產中的使用者。對於 18 歲以下的人,採取了額外的適合年齡的保護措施,進一步限制性內容和接觸暴力圖片。

針對 18 歲以下用戶的保護和限制
人工智慧系統可以為青少年帶來巨大的好處,幫助他們學習、創造、解決問題和發展新技能。 OpenAI 精心設計其係統,以最大限度地發揮這些優勢,同時減輕可能對 18 歲以下用戶造成不成比例或更嚴重影響的潛在危害。模型規格中定義了指導模型行為的原則和要求。
對於青少年來說,安全政策中實施了針對年齡的規定,在性內容、情感依賴、飲食失調和獲得年齡限制的商品/服務等領域比適用於成年人的規定更嚴格。此模型經過訓練,可以避免浪漫的角色扮演、鼓勵年齡限制的挑戰,或將自己定位為真實關係的替代品。此外,當它識別出青少年可能需要支持的跡象時,該系統旨在加強健康的界限,並鼓勵與值得信賴的成年人(如父母或老師)建立聯繫。系統級安全措施增加了一個額外的層,限制對敏感內容的訪問,鼓勵延長使用時間,並為家長提供管理工具。不到 18 則具體評論證明了 GPT-5.6 Sol e Luna 的可靠性能,包括對年齡限制產品/服務和色情內容的改進。
模型視覺能力與評估
OpenAI 還執行影像輸入評估,以測量模型的「not_unsafe」輸出,考慮不允許的文字和圖像組合。結果表明,GPT-5.6 Sol 在視力評估方面的表現與 GPT-5.5-Instant 相當。 GPT-5.6 Luna 則在極端主義評估中出現了小幅回歸,統計顯著性較低,表明整體能力仍然強勁。
透過使用者模擬進行心理健康測試
為了進一步分析,該公司引入了針對心理健康、情緒依賴和自殘的動態多重互動評估。與靜態測試不同,這些模擬允許對話根據模型輸出而發展,從而創建更現實和嚴格的測試軌跡。這種方法有助於識別長時間互動中可能出現的潛在問題,從而提供更準確的測試。
測試表明,GPT-5.6 Sol 在這些評估中與 GPT-5.5 即時六月更新大致相當,儘管在自我傷害評估中觀察到統計上顯著的回歸。然而,在線上實驗期間並沒有記錄到對自殘、心理健康和情感依賴的不良反應增加。該公司在發布後繼續監控這些方面,以驗證結果並調查離線和線上測試之間的潛在差異。
提高模型的穩健性
該模型的穩健性是針對「越獄」進行測試的,「越獄」是一種對抗性刺激,旨在繞過模型的拒絕訓練並獲得有害的幫助。此評估的重點是直接解鎖模型,而無需在生產中提供全套保障措施。它是安全措施中的一層穩健性。 OpenAI 使用源自內部入侵練習的複雜攻擊策略,可以在對話過程中進行探測、適應和升級。儘管高攻擊預算場景中存在預期變化,但 GPT-5.6 Sol 和 GPT-5.6 Luna 的性能被認為與其最近的前輩相當。
了解更多: 學校攻擊:普雷圖河畔聖若澤(SP)青少年頭部被刺傷
也評估了對連接器的即時注入攻擊的抵抗力。這些攻擊將惡意指令插入工具的輸出中,以欺騙模型並覆蓋系統、開發人員或使用者指令。測試中包含了這些攻擊的改進版本,重點是搜尋和函數呼叫。在這些評估中,GPT-5.6 Sol 和 GPT-5.6 Luna 模型表現出了與先前的 Instant 模型相當的表現。
健康表現的改善
聊天機器人有潛力讓人們更了解自己的健康狀況。因此,新模型在衡量健康績效和安全性的 HealthBench 以及專注於臨床用例的 HealthBench Professional 中進行了評估。為了防止較長的反應(這可能會人為地提高分數)損害可用性和安全性,結果將調整為最終反應長度。較短的反應會受到積極的調整,而較長的反應會受到懲罰。
GPT-5.6 Sol 版本在所有 HealthBench 類別中均比 GPT-5.5 Instant 有所改進,在 HealthBench Professional 和 HealthBench Hard 方面有顯著提升。某些類別的回答較短,其他類別的回答稍長,但調整後和未調整的分數總體有所提高。儘管尺寸較小,GPT-5.6 Luna 在所有評估中也顯示出了改進。這些改進預計將使所有用戶能夠更廣泛地獲得可靠的健康資訊。
減少幻覺並提高事實準確性
為了評估模型提供事實正確答案的能力,OpenAI 測量了一組具有挑戰性的提示中出現事實幻覺的比率,這些提示被選擇來代表模型最有可能產生幻覺的場景。這些評估被設計得很困難,並隨著時間的推移提供敏感的研究訊號,而不是衡量生產中的整體盛行率或平均使用者體驗。場景包括來自 ChatGPT 對話的以事實為中心的提示、用戶報告的先前版本中的崩潰以及高風險的醫療、法律和財務狀況。
結果表明,在所有評估中,與 GPT-5.5 Instant 相比,GPT-5.6 Sol 和 GPT-5.6 Luna 在事實準確性方面都有顯著提高。 GPT-5.6 Luna 能夠將高風險問題的事實錯誤率降低超過 60%,將其他兩組問題的事實錯誤率降低約 30%。 GPT-5.6 Sol 表現出了統計上顯著且更一致的改進,將所有三個問題集的事實錯誤率降低了約 60%。這項改進旨在提高使用者對模型提供的資訊的信心。
準備框架和保障措施
同一主題報導: 一名女子因與青少年拍攝親密影片讓前伴侶嫉妒而在塞阿拉被拘留
OpenAI 準備框架是監控和準備可能造成嚴重損害風險的邊緣功能的方法。在此框架內,該公司致力於透過實施充分減少高性能模型危險的保障措施來減輕這些風險。更新後的 GPT-5.6 Sol 和 GPT-5.6 Luna 模型具有與先前發布的 GPT-5.6 模型相同的就緒框架評級:生物和化學安全性高、網路安全性高、人工智慧自我改進性低於高。
能力評估代表了潛在能力的下限,因為額外的線索、微調或創新的交互作用可能會引發超越測試中觀察到的行為。在生物和化學領域,「高能力」的定義是模型可以為「新手」參與者創造已知的嚴重威脅提供重要幫助。病毒學和隱性知識測試表明,更新後的模型在某些領域超過了專家閾值,而在其他領域則低於專家閾值,例如排除實驗室協議故障的能力。
在網路安全中,「高容量」是指針對合理保護的目標或發現/利用漏洞的自動化端對端網路操作的模型。奪旗(CTF)和 CVE-Bench 挑戰測試表明,GPT-5.6 Sol 和 Luna 在某些場景下超越了高就緒閾值,其中 Sol 在 CTF 中達到了 97.06%。在網路靶場模擬中,Sol 比 Luna 表現出更大的成功,兩者都在特定的高複雜性場景中提出了挑戰。由於 GPT-5.6 Sol 已經低於高容量水平,因此未進行 AI 自我改進評估。實施的保障措施旨在阻止和發現被禁止的攻擊性活動,同時維護生物和網路安全能力的合法防禦和科學用途,加強線上和線下安全。















