ChatGPT nhận được những cải tiến trong tháng 8: GPT-5.6 mang đến sự mạnh mẽ và tập trung vào bảo mật cho mọi người
OpenAI sẽ phát hành một loạt bản cập nhật cho ChatGPT vào tháng 8, giới thiệu các mô hình mạnh mẽ hơn và mở rộng quyền truy cập vào các tính năng nâng cao. Người dùng phiên bản Free và Go giờ đây sẽ sử dụng mô hình tiêu chuẩn mới cho các tương tác hàng ngày của họ. Những người đăng ký gói Plus và Pro sẽ có quyền truy cập vào phiên bản cải tiến của GPT-5.6 Sol, bao gồm một thanh trượt để điều chỉnh mức độ nỗ lực của ChatGPT khi tạo phản hồi. Những mẫu mới này thay thế GPT-5.5 Instant, đánh dấu sự tiến bộ đáng kể về trải nghiệm người dùng.
Công ty củng cố rằng các phiên bản tháng 8 của GPT-5.6 Sol và GPT-5.6 Luna được coi là có dung lượng cao về mặt an ninh mạng cũng như nhận dạng sinh học và hóa học, theo Khung chuẩn bị của nó. Tuy nhiên, cả hai phiên bản đều không đạt đến ngưỡng công suất cao trong việc tự cải tiến AI. Đánh giá bảo mật của các mô hình được thực hiện ở cài đặt cơ bản nhất, chẳng hạn như chế độ chụp nhanh, để nắm bắt hiệu suất trong hầu hết các mục đích sử dụng, trong khi các khả năng được kiểm tra ở nỗ lực suy luận tối đa.
Lần đầu tiên, OpenAI đã đưa vào các đánh giá cụ thể cho người dùng dưới 18 tuổi. Những phân tích này được phát triển để đo lường hành vi của các mô hình so với các tiêu chuẩn bảo mật được tạo ra đặc biệt cho thanh thiếu niên, thể hiện nỗ lực không ngừng nhằm giúp ChatGPT an toàn hơn cho nhóm tuổi này.
Chi tiết về các mô hình và quy trình đào tạo
Các mẫu GPT-5.6 Sol và GPT-5.6 Luna, giống như các mẫu khác do OpenAI phát triển, đã được đào tạo trên các bộ dữ liệu khổng lồ. Điều này bao gồm thông tin có sẵn công khai trên internet, dữ liệu thu được thông qua quan hệ đối tác với bên thứ ba và thông tin được cung cấp hoặc tạo bởi người dùng, giảng viên và nhà nghiên cứu. Công ty sử dụng quy trình lọc dữ liệu nghiêm ngặt để đảm bảo chất lượng và giảm thiểu rủi ro có thể xảy ra. Bộ phân loại an toàn được sử dụng để ngăn chặn hoặc giảm thiểu sự xuất hiện của nội dung nhạy cảm hoặc có hại, chẳng hạn như tài liệu khiêu dâm liên quan đến trẻ vị thành niên.
OpenAI chỉ ra rằng các giá trị so sánh của các mô hình đã phát hành trước đó có thể có những khác biệt nhỏ so với các giá trị được công bố ban đầu, vì chúng đề cập đến các phiên bản mới nhất của các mô hình này. Công ty nhắc lại rằng việc sử dụng GPT-5.6 phải tuân theo Chính sách sử dụng, Điều khoản dịch vụ và Điều khoản sử dụng, đảm bảo việc sử dụng công nghệ trí tuệ nhân tạo một cách có trách nhiệm.
Đánh giá bảo mật về nội dung bị cấm
Để đảm bảo tuân thủ các chính sách của mình, OpenAI thực hiện đo điểm chuẩn trên một số danh mục nội dung bị cấm. Công ty sử dụng Điểm chuẩn sản xuất, một bộ phân tích bao gồm các cuộc hội thoại đầy thách thức được rút ra từ dữ liệu sử dụng trong thế giới thực. Những tiêu chuẩn này được thiết kế nhằm mục đích khó khăn và giúp đo lường sự tiến bộ, đặc biệt khi các đánh giá tiêu chuẩn đã cho thấy mức hiệu suất cao. Tỷ lệ lỗi quan sát được trong các đánh giá này không phản ánh lưu lượng sản xuất trung bình mà là một thử nghiệm nghiêm ngặt về hoạt động của mô hình mà không có biện pháp bảo vệ cấp hệ thống.
Cùng chủ đề: Tính năng thử nghiệm ChatGPT để tạo và xuất nhãn dán WhatsApp
Đánh giá GPT-5.6 Sol so với Bản cập nhật tức thì tháng 6 của GPT-5.5, kết quả cho thấy hiệu suất tương tự trên tất cả các danh mục bị cấm, ngoại trừ nội dung bạo lực và tình dục, trong đó không có sự khác biệt đáng kể về mặt thống kê. Đối với GPT-5.6 Luna, hiệu suất cũng tương đương, ngoại trừ nội dung bạo lực. Liên quan đến nội dung tình dục bị cấm, OpenAI đã triển khai biện pháp giảm thiểu bổ sung ở cấp hệ thống để ngăn tài liệu khiêu dâm rõ ràng tiếp cận người dùng trong quá trình sản xuất. Đối với những người dưới 18 tuổi, các biện pháp bảo vệ bổ sung phù hợp với lứa tuổi đã được áp dụng, hạn chế hơn nữa nội dung khiêu dâm và tiếp xúc với tài liệu bạo lực bằng hình ảnh.

Các biện pháp bảo vệ và giới hạn đối với người dùng dưới 18 tuổi
Hệ thống trí tuệ nhân tạo có thể mang lại lợi ích to lớn cho thanh thiếu niên, giúp họ học hỏi, sáng tạo, giải quyết vấn đề và phát triển các kỹ năng mới. OpenAI cẩn thận thiết kế các hệ thống của mình để tối đa hóa những lợi ích này, đồng thời giảm thiểu những tác hại tiềm ẩn có thể ảnh hưởng không cân xứng hoặc nghiêm trọng hơn đến người dùng dưới 18 tuổi. Các nguyên tắc và yêu cầu hướng dẫn hành vi của các mô hình được xác định trong Thông số kỹ thuật mô hình.
Tìm hiểu thêm: Thiếu niên giết mẹ và anh trai sau khi dùng AI để tạo ảo giác về tội ác
Đối với thanh thiếu niên, các quy định cụ thể về độ tuổi được thực hiện trong các chính sách an toàn, thiết lập các giới hạn hạn chế hơn so với những quy định áp dụng cho người lớn trong các lĩnh vực như nội dung tình dục, phụ thuộc về mặt cảm xúc, rối loạn ăn uống và khả năng tiếp cận hàng hóa/dịch vụ bị giới hạn độ tuổi. Người mẫu được đào tạo để tránh những trò nhập vai lãng mạn, khuyến khích những thử thách giới hạn độ tuổi hoặc tự coi mình là người thay thế cho các mối quan hệ thực sự. Ngoài ra, khi xác định các dấu hiệu cho thấy thanh thiếu niên có thể cần hỗ trợ, hệ thống được thiết kế để củng cố các ranh giới lành mạnh và khuyến khích kết nối với những người lớn đáng tin cậy, như cha mẹ hoặc giáo viên. Các biện pháp bảo mật cấp hệ thống bổ sung thêm một lớp, hạn chế quyền truy cập vào nội dung nhạy cảm, khuyến khích thời gian sử dụng kéo dài và cung cấp các công cụ quản lý cho phụ huynh. Dưới 18 bài đánh giá cụ thể chứng minh hiệu suất vững chắc của GPT-5.6 Sol e Luna, bao gồm các cải tiến liên quan đến các sản phẩm/dịch vụ bị giới hạn độ tuổi và nội dung tình dục.
Khả năng và đánh giá tầm nhìn mô hình
OpenAI cũng thực hiện đánh giá đầu vào hình ảnh để đo lường đầu ra “không_không an toàn” của mô hình, xem xét các kết hợp văn bản và hình ảnh không được phép. Kết quả cho thấy hiệu năng của GPT-5.6 Sol trong các bài đánh giá thị lực tương đương với GPT-5.5-Instant. Ngược lại, GPT-5.6 Luna cho thấy sự hồi quy nhỏ trong đánh giá chủ nghĩa cực đoan, với ý nghĩa thống kê thấp, cho thấy năng lực tổng thể vẫn mạnh mẽ.
Kiểm tra sức khỏe tâm thần bằng mô phỏng của người dùng
Để phân tích sâu hơn, công ty đã giới thiệu các đánh giá đa tương tác linh hoạt về sức khỏe tâm thần, sự phụ thuộc về mặt cảm xúc và hành vi tự làm hại bản thân. Không giống như các thử nghiệm tĩnh, những mô phỏng này cho phép các cuộc hội thoại phát triển để đáp ứng với kết quả đầu ra của mô hình, tạo ra các quỹ đạo thử nghiệm thực tế và nghiêm ngặt hơn. Cách tiếp cận này giúp xác định các vấn đề tiềm ẩn có thể phát sinh khi tương tác kéo dài, cung cấp thử nghiệm chính xác hơn.
Thử nghiệm cho thấy GPT-5.6 Sol nhìn chung có thể so sánh với Bản cập nhật tức thời tháng 6 của GPT-5.5 trong các đánh giá này, mặc dù đã quan sát thấy sự hồi quy có ý nghĩa thống kê trong đánh giá tự gây hại. Tuy nhiên, sự gia tăng các phản ứng không mong muốn đối với việc tự làm hại bản thân, sức khỏe tâm thần và sự phụ thuộc về mặt cảm xúc đã không được ghi nhận trong quá trình thử nghiệm trực tuyến. Công ty tiếp tục theo dõi các khía cạnh này sau khi ra mắt để xác minh kết quả và điều tra những khác biệt tiềm ẩn giữa thử nghiệm ngoại tuyến và trực tuyến.
Thêm về chủ đề này: OpenAI mở khóa các cuộc hội thoại văn bản không giới hạn cho tài khoản ChatGPT miễn phí
Cải thiện độ bền của mô hình
Độ bền của mô hình được kiểm tra trước “bẻ khóa”, là những tác nhân kích thích đối nghịch được thiết kế để vượt qua quá trình đào tạo từ chối của mô hình và nhận được sự trợ giúp có hại. Đánh giá này tập trung vào việc trực tiếp mở khóa mô hình mà không có đầy đủ các biện pháp bảo vệ trong sản xuất. Đó là một lớp mạnh mẽ trong các biện pháp an ninh. OpenAI sử dụng các chiến lược tấn công tinh vi bắt nguồn từ các hoạt động xâm nhập nội bộ, có thể thăm dò, điều chỉnh và leo thang trong quá trình trò chuyện. Bất chấp sự thay đổi dự kiến trong các kịch bản ngân sách tấn công cao, hiệu suất của GPT-5.6 Sol và GPT-5.6 Luna được coi là tương đương với các phiên bản tiền nhiệm gần đây của chúng.
Khả năng chống lại các cuộc tấn công tiêm ngay lập tức vào các đầu nối cũng được đánh giá. Các cuộc tấn công này chèn các hướng dẫn độc hại vào đầu ra của công cụ để đánh lừa mô hình và ghi đè lên hướng dẫn của hệ thống, nhà phát triển hoặc người dùng. Các phiên bản cải tiến của các cuộc tấn công này, tập trung vào tìm kiếm và gọi hàm, đã được đưa vào thử nghiệm. Các mẫu GPT-5.6 Sol và GPT-5.6 Luna đã thể hiện hiệu suất tương đương với các mẫu Instant trước đó trong các đánh giá này.
Cải thiện hiệu suất sức khỏe
Chatbots có khả năng giúp mọi người hiểu rõ hơn về sức khỏe của họ. Do đó, các mô hình mới đã được đánh giá trong HealthBench, đo lường hiệu suất sức khỏe và độ an toàn, và trong HealthBench Professional, tập trung vào các trường hợp sử dụng lâm sàng. Để ngăn phản hồi dài hơn, có thể làm tăng điểm một cách giả tạo, gây tổn hại đến khả năng sử dụng và bảo mật, kết quả được điều chỉnh theo độ dài phản hồi cuối cùng. Những câu trả lời ngắn hơn sẽ nhận được sự điều chỉnh tích cực, trong khi những câu trả lời dài hơn sẽ bị phạt.
Bản phát hành GPT-5.6 Sol mang lại những cải tiến so với GPT-5.5 Instant trên tất cả các danh mục HealthBench, với mức tăng đáng kể về HealthBench Professional và HealthBench Hard. Các câu trả lời ngắn hơn ở một số hạng mục và dài hơn một chút ở những hạng mục khác, nhưng nhìn chung điểm được điều chỉnh và không điều chỉnh đã được cải thiện. GPT-5.6 Luna cũng cho thấy sự cải thiện trong mọi đánh giá mặc dù có kích thước nhỏ hơn. Những cải tiến này dự kiến sẽ mang lại khả năng tiếp cận rộng rãi hơn tới thông tin sức khỏe đáng tin cậy cho tất cả người dùng.
Giảm ảo giác và tăng độ chính xác thực tế
Để đánh giá khả năng đưa ra câu trả lời chính xác về mặt thực tế của mô hình, OpenAI đo lường tỷ lệ ảo giác thực tế trong các nhóm lời nhắc đầy thách thức, được chọn để thể hiện các tình huống trong đó mô hình có nhiều khả năng bị ảo giác nhất. Những đánh giá này được thiết kế nhằm giảm độ khó và cung cấp tín hiệu nghiên cứu nhạy cảm theo thời gian, thay vì đo lường mức độ phổ biến chung trong quá trình sản xuất hoặc trải nghiệm người dùng trung bình. Các tình huống bao gồm lời nhắc tập trung vào thực tế từ các cuộc trò chuyện ChatGPT, sự cố do người dùng báo cáo trong các phiên bản trước và các tình huống y tế, pháp lý và tài chính có rủi ro cao.
Tìm hiểu thêm: OpenAI giới thiệu mô hình Astra mới và những tiến bộ trong lý luận trí tuệ nhân tạo
Kết quả chỉ ra rằng GPT-5.6 Sol và GPT-5.6 Luna cho thấy sự cải thiện đáng kể về độ chính xác thực tế so với GPT-5.5 Instant trong tất cả các đánh giá. GPT-5.6 Luna có thể giảm hơn 60% tỷ lệ lỗi thực tế đối với các câu hỏi có tính đặt cược cao và khoảng 30% đối với hai bộ câu hỏi còn lại. GPT-5.6 Sol đã chứng minh những cải tiến có ý nghĩa thống kê và nhất quán hơn, giảm tỷ lệ lỗi thực tế khoảng 60% trên cả ba bộ câu hỏi. Cải tiến này nhằm mục đích tăng cường sự tin cậy của người dùng đối với thông tin do các mô hình cung cấp.
Khung chuẩn bị và các biện pháp bảo vệ
Khung chuẩn bị OpenAI là cách tiếp cận để giám sát và chuẩn bị cho các khả năng tiên tiến có thể gây ra nguy cơ gây tổn hại nghiêm trọng. Trong khuôn khổ này, công ty nỗ lực giảm thiểu những rủi ro này bằng cách triển khai các biện pháp bảo vệ giúp giảm thiểu đủ mức nguy hiểm đối với các mẫu xe có năng lực cao. Các mẫu GPT-5.6 Sol và GPT-5.6 Luna được cập nhật đảm bảo xếp hạng Khung sẵn sàng giống như các mẫu GPT-5.6 đã phát hành trước đó: An ninh sinh học và hóa học cao, An ninh mạng cao và Khả năng tự cải thiện AI thấp hơn.
Đánh giá năng lực thể hiện giới hạn thấp hơn về khả năng tiềm năng, vì các tín hiệu bổ sung, tinh chỉnh hoặc tương tác đổi mới có thể gợi ra những hành vi vượt quá những gì đã được quan sát trong quá trình thử nghiệm. Trong lĩnh vực sinh học và hóa học, “khả năng cao” được xác định bằng sự hỗ trợ đáng kể mà các mô hình có thể cung cấp cho những tác nhân “mới” trong việc tạo ra các mối đe dọa nghiêm trọng đã biết. Các thử nghiệm về virus học và kiến thức ngầm cho thấy các mô hình cập nhật đã vượt qua ngưỡng chuyên gia ở một số lĩnh vực, trong khi lại kém ở những lĩnh vực khác, chẳng hạn như khả năng khắc phục sự cố các quy trình trong phòng thí nghiệm.
Trong an ninh mạng, “công suất cao” được xác định bằng các mô hình tự động hóa các hoạt động mạng từ đầu đến cuối chống lại các mục tiêu được bảo vệ hợp lý hoặc phát hiện/khai thác các lỗ hổng. Thử nghiệm trên các thử thách Capture the Flag (CTF) và CVE-Bench cho thấy GPT-5.6 Sol và Luna đã vượt qua ngưỡng sẵn sàng cao trong một số tình huống, trong đó Sol đạt 97,06% CTF. Trong các mô phỏng phạm vi mạng, Sol đã thể hiện thành công lớn hơn Luna, cả hai đều đưa ra những thách thức trong các tình huống cụ thể có độ phức tạp cao. Các đánh giá tự cải thiện AI đã không được thực hiện vì GPT-5.6 Sol đã ở dưới mức công suất cao. Các biện pháp bảo vệ được triển khai nhằm mục đích cản trở và phát hiện các hoạt động tấn công bị cấm, đồng thời duy trì mục đích sử dụng khoa học và phòng thủ hợp pháp của các khả năng sinh học và an ninh mạng, tăng cường an ninh trực tuyến và ngoại tuyến.















