يتلقى ChatGPT تحسينات في أغسطس: يوفر GPT-5.6 التركيز على المتانة والأمان للجميع

OpenAI ChatGPT

OpenAI ChatGPT - Foto: One Artist / Shutterstock.com

تطلق OpenAI سلسلة من التحديثات لـ ChatGPT في أغسطس، حيث تقدم نماذج أكثر قوة وتوسع الوصول إلى الميزات المتقدمة. سيستخدم مستخدمو الإصدارين Free and Go الآن نموذجًا قياسيًا جديدًا لتفاعلاتهم اليومية. سيتمكن أولئك الذين يشتركون في خطتي Plus وPro من الوصول إلى نسخة محسنة من GPT-5.6 Sol، والتي تتضمن شريط تمرير لضبط مستوى جهد ChatGPT عند إنشاء الاستجابات. تحل هذه الطرازات الجديدة محل GPT-5.5 Instant، مما يمثل تقدمًا كبيرًا في تجربة المستخدم.

وأكدت الشركة أن إصدارات أغسطس من GPT-5.6 Sol وGPT-5.6 Luna تعتبر ذات قدرة عالية من حيث الأمن السيبراني والتعرف البيولوجي والكيميائي، وفقًا لإطار الإعداد الخاص بها. ومع ذلك، لم يصل أي من الإصدارين إلى عتبة القدرة العالية في التحسين الذاتي للذكاء الاصطناعي. يتم إجراء تقييم الأمان للنماذج في معظم إعداداتها الأساسية، مثل وضع اللقطة، لالتقاط الأداء عبر معظم الاستخدامات، بينما يتم اختبار القدرات بأقصى جهد منطقي.

لأول مرة، قامت OpenAI بتضمين تقييمات محددة للمستخدمين تحت سن 18 عامًا. وقد تم تطوير هذه التحليلات لقياس سلوك النماذج مقابل معايير الأمان التي تم إنشاؤها خصيصًا للمراهقين، مما يدل على الجهد المستمر لجعل ChatGPT أكثر أمانًا لهذه الفئة العمرية.

تفاصيل حول النماذج وعملية التدريب

تم تدريب نماذج GPT-5.6 Sol وGPT-5.6 Luna، مثل النماذج الأخرى التي طورتها OpenAI، على مجموعات بيانات ضخمة. يتضمن ذلك المعلومات المتاحة للجمهور على الإنترنت، والبيانات التي تم الحصول عليها من خلال الشراكات مع أطراف ثالثة، والمعلومات المقدمة أو التي تم إنشاؤها بواسطة المستخدمين والمدربين والباحثين. تستخدم الشركة عملية تصفية بيانات صارمة لضمان الجودة وتقليل المخاطر المحتملة. يتم استخدام مصنفات الأمان لمنع أو التخفيف من وجود محتوى حساس أو ضار، مثل المواد الجنسية الصريحة التي تتضمن قاصرين.

ويشير OpenAI إلى أن قيم المقارنة للنماذج التي تم إصدارها مسبقًا قد يكون لها اختلافات بسيطة فيما يتعلق بالقيم المنشورة في البداية، لأنها تشير إلى أحدث الإصدارات من هذه النماذج. تؤكد الشركة مجددًا أن استخدام GPT-5.6 يجب أن يكون متوافقًا مع سياسات الاستخدام وشروط الخدمة وشروط الاستخدام الخاصة بها، والتي تضمن الاستخدام المسؤول لتقنية الذكاء الاصطناعي.

التقييمات الأمنية على المحتوى المحظور

ولضمان الامتثال لسياساتها، تقوم OpenAI بإجراء قياس الأداء عبر عدة فئات من المحتوى المحظور. تستخدم الشركة معايير الإنتاج، وهي مجموعة من التحليلات التي تتضمن محادثات صعبة مستمدة من بيانات الاستخدام في العالم الحقيقي. تم تصميم هذه المعايير لتكون صعبة وتساعد في قياس التقدم، خاصة عندما أظهرت التقييمات القياسية بالفعل مستويات عالية من الأداء. ولا تعكس معدلات الخطأ التي تمت ملاحظتها في هذه التقييمات متوسط ​​حركة الإنتاج، بل هي اختبار صارم لسلوك النموذج دون ضمانات على مستوى النظام.

عند تقييم GPT-5.6 Sol مقابل تحديث GPT-5.5 الفوري لشهر يونيو، تظهر النتائج أداءً مشابهًا في جميع الفئات المحظورة، باستثناء المحتوى العنيف والجنسي، حيث لم يكن هناك فرق ذو دلالة إحصائية. بالنسبة لـ GPT-5.6 Luna، كان الأداء مشابهًا أيضًا، باستثناء المحتوى العنيف. فيما يتعلق بالمحتوى الجنسي المحظور، نفذت OpenAI إجراءات تخفيف إضافية على مستوى النظام لمنع المواد المثيرة الصريحة من الوصول إلى المستخدمين في الإنتاج. بالنسبة لمن تقل أعمارهم عن 18 عامًا، تم تطبيق إجراءات حماية إضافية مناسبة لعمرهم، مما يزيد من تقييد المحتوى الجنسي والتعرض للمواد العنيفة المصورة.

شعار ChatGPT – ماركوس ماينكا / Shutterstock.com

الحماية والحدود للمستخدمين الذين تقل أعمارهم عن 18 عامًا

يمكن أن تقدم أنظمة الذكاء الاصطناعي فوائد كبيرة للمراهقين، حيث تساعدهم على التعلم والإبداع وحل المشكلات وتطوير مهارات جديدة. تصمم OpenAI أنظمتها بعناية لتحقيق أقصى قدر من هذه الفوائد، مع تخفيف الأضرار المحتملة التي قد تؤثر بشكل غير متناسب أو أكثر خطورة على المستخدمين الذين تقل أعمارهم عن 18 عامًا. ويتم تحديد المبادئ والمتطلبات التي توجه سلوك النماذج في مواصفات النموذج.

بالنسبة للمراهقين، يتم تنفيذ أحكام خاصة بالعمر في سياسات السلامة، مما يضع حدودًا أكثر تقييدًا من تلك المطبقة على البالغين في مجالات مثل المحتوى الجنسي، والاعتماد العاطفي، واضطرابات الأكل، والوصول إلى السلع / الخدمات المقيدة بالعمر. يتم تدريب النموذج على تجنب لعب الأدوار الرومانسية، أو تشجيع التحديات المقيدة بالعمر، أو تقديم نفسه كبديل للعلاقات الحقيقية. بالإضافة إلى ذلك، عندما يحدد النظام علامات تشير إلى أن المراهق قد يحتاج إلى الدعم، فقد تم تصميم النظام لتعزيز الحدود السليمة وتشجيع التواصل مع البالغين الموثوق بهم، مثل الآباء أو المعلمين. تضيف إجراءات الأمان على مستوى النظام طبقة إضافية، مما يحد من الوصول إلى المحتوى الحساس، ويشجع فترات انقطاع ممتدة في الاستخدام، ويوفر أدوات الإدارة للآباء. تُظهر أقل من 18 مراجعة محددة أداءً قويًا من GPT-5.6 Sol e Luna، بما في ذلك التحسينات المتعلقة بالمنتجات/الخدمات المقيدة بالعمر والمحتوى الجنسي.

نموذج قدرات الرؤية والتقييمات

تقوم OpenAI أيضًا بإجراء تقييمات لإدخال الصور لقياس مخرجات النموذج “غير الآمنة”، مع الأخذ في الاعتبار مجموعات النص والصور غير المسموح بها. أظهرت النتائج أن أداء GPT-5.6 Sol في تقييمات الرؤية يعادل أداء GPT-5.5-Instant. وأظهر GPT-5.6 Luna بدوره تراجعًا بسيطًا في تقييم التطرف، مع أهمية إحصائية منخفضة، مما يشير إلى أن القدرة الإجمالية لا تزال قوية.

اختبار الصحة العقلية مع محاكاة المستخدم

لمزيد من التحليل، قدمت الشركة تقييمات ديناميكية متعددة التفاعل للصحة العقلية والاعتماد العاطفي وإيذاء النفس. على عكس الاختبارات الثابتة، تسمح عمليات المحاكاة هذه للمحادثات بالتطور استجابة لمخرجات النموذج، مما يؤدي إلى إنشاء مسارات اختبار أكثر واقعية وصرامة. ويساعد هذا النهج في تحديد المشاكل المحتملة التي قد تنشأ خلال التفاعلات المطولة، مما يوفر اختبارًا أكثر دقة.

يكشف الاختبار أن GPT-5.6 Sol يمكن مقارنته على نطاق واسع بتحديث يونيو الفوري GPT-5.5 في هذه التقييمات، على الرغم من ملاحظة تراجع ذي دلالة إحصائية في تقييم إيذاء النفس. ومع ذلك، لم يتم تسجيل زيادة في الاستجابات غير المرغوب فيها لإيذاء النفس والصحة العقلية والاعتماد العاطفي أثناء التجربة عبر الإنترنت. تستمر الشركة في مراقبة هذه الجوانب بعد الإطلاق للتحقق من النتائج والتحقيق في التناقضات المحتملة بين الاختبار دون الاتصال بالإنترنت والاختبار عبر الإنترنت.

تحسين متانة النماذج

يتم اختبار قوة النموذج ضد “عمليات الهروب من السجن”، وهي عبارة عن محفزات عدائية مصممة لتجاوز تدريب النموذج على الرفض والحصول على مساعدة ضارة. يركز هذا التقييم على فتح النموذج بشكل مباشر، دون الحاجة إلى مجموعة كاملة من الضمانات في الإنتاج. إنها طبقة من المتانة في التدابير الأمنية. يستخدم OpenAI إستراتيجيات هجوم متطورة مستمدة من تمارين التطفل الداخلي، والتي يمكنها التحقيق والتكيف والتصعيد على مدار المحادثة. على الرغم من التباين المتوقع في سيناريوهات ميزانية الهجوم العالية، فإن أداء GPT-5.6 Sol وGPT-5.6 Luna يعتبر مشابهًا لأسلافهما الحديثين.

يتم أيضًا تقييم المقاومة ضد هجمات الحقن الفوري على الموصلات. تقوم هذه الهجمات بإدخال تعليمات ضارة في مخرجات الأداة لخداع النموذج والكتابة فوق تعليمات النظام أو المطور أو المستخدم. تم تضمين الإصدارات المحسنة من هذه الهجمات، التي تركز على البحث واستدعاء الوظائف، في الاختبارات. أظهر طرازا GPT-5.6 Sol وGPT-5.6 Luna أداءً مكافئًا للنماذج الفورية السابقة في هذه التقييمات.

تحسينات في الأداء الصحي

تتمتع Chatbots بالقدرة على تمكين الأشخاص من فهم صحتهم بشكل أفضل. ولذلك، تم تقييم النماذج الجديدة في HealthBench، الذي يقيس الأداء الصحي والسلامة، وفي HealthBench Professional، الذي يركز على حالات الاستخدام السريري. ولمنع الاستجابات الأطول، والتي يمكن أن تؤدي إلى تضخيم النتائج بشكل مصطنع، من الإضرار بسهولة الاستخدام والأمان، يتم تعديل النتائج وفقًا لطول الاستجابة النهائية. تحصل الإجابات الأقصر على تعديل إيجابي، بينما تتم معاقبة الإجابات الأطول.

يوفر إصدار GPT-5.6 Sol تحسينات مقارنة بـ GPT-5.5 Instant عبر جميع فئات HealthBench، مع مكاسب كبيرة في HealthBench Professional وHealthBench Hard. وكانت الإجابات أقصر في بعض الفئات وأطول قليلا في فئات أخرى، ولكن النتائج المعدلة وغير المعدلة تحسنت بشكل عام. أظهر GPT-5.6 Luna أيضًا تحسينات في جميع التقييمات على الرغم من صغر حجمه. ومن المتوقع أن تؤدي هذه التحسينات إلى توسيع نطاق الوصول إلى المعلومات الصحية الموثوقة لجميع المستخدمين.

انخفاض الهلوسة وزيادة دقة الحقائق

ولتقييم قدرة النماذج على تقديم إجابات صحيحة واقعيًا، يقيس OpenAI معدل الهلوسة الواقعية في مجموعات من المحفزات الصعبة، التي تم اختيارها لتمثيل السيناريوهات التي من المرجح أن يصاب فيها النموذج بالهلوسة. تم تصميم هذه التقييمات لتكون صعبة وتوفر إشارة بحثية حساسة مع مرور الوقت، بدلاً من قياس الانتشار العام في الإنتاج أو متوسط ​​تجربة المستخدم. تتضمن السيناريوهات مطالبات تركز على الحقائق من محادثات ChatGPT، والأعطال التي أبلغ عنها المستخدم في الإصدارات السابقة، والمواقف الطبية والقانونية والمالية عالية الخطورة.

تشير النتائج إلى أن GPT-5.6 Sol وGPT-5.6 Luna يظهران تحسينات كبيرة في الدقة الواقعية مقارنة بـGPT-5.5 Instant عبر جميع التقييمات. تمكنت GPT-5.6 Luna من تقليل معدلات الخطأ الواقعي بأكثر من 60% في الأسئلة عالية المخاطر وحوالي 30% في المجموعتين الأخريين من الأسئلة. أظهر GPT-5.6 Sol تحسينات ذات دلالة إحصائية وأكثر اتساقًا، مما أدى إلى تقليل معدلات الخطأ الواقعي بحوالي 60% عبر مجموعات الأسئلة الثلاثة. ويهدف هذا التحسين إلى زيادة ثقة المستخدمين في المعلومات التي تقدمها النماذج.

إطار الاستعداد والضمانات

إن إطار عمل الاستعداد لـ OpenAI هو نهجه في المراقبة والتحضير لقدرات الحافة التي يمكن أن تشكل خطر حدوث ضرر جسيم. وفي هذا الإطار، تعمل الشركة على التخفيف من هذه المخاطر من خلال تنفيذ ضمانات تقلل بشكل كافٍ من المخاطر بالنسبة للنماذج ذات القدرة العالية. يضمن طرازا GPT-5.6 Sol وGPT-5.6 Luna المحدثان نفس تقييمات إطار الاستعداد مثل نماذج GPT-5.6 التي تم إصدارها مسبقًا: مستوى عالٍ من الأمان البيولوجي والكيميائي، ومستوى عالٍ من الأمن السيبراني، وأقل من مستوى عالٍ في التحسين الذاتي للذكاء الاصطناعي.

تمثل تقييمات القدرة حدًا أدنى للقدرات المحتملة، حيث قد تؤدي الإشارات الإضافية أو الضبط الدقيق أو التفاعلات المبتكرة إلى إثارة سلوكيات تتجاوز ما تمت ملاحظته في الاختبار. في المجالين البيولوجي والكيميائي، يتم تعريف “القدرة العالية” من خلال المساعدة الكبيرة التي يمكن أن تقدمها النماذج للجهات الفاعلة “المبتدئة” في خلق تهديدات خطيرة معروفة. وأظهرت الاختبارات في علم الفيروسات والمعرفة الضمنية أن النماذج المحدثة تجاوزت عتبات الخبراء في بعض المجالات، بينما كانت قاصرة في مجالات أخرى، مثل القدرة على استكشاف أخطاء البروتوكولات المختبرية وإصلاحها.

في مجال الأمن السيبراني، يتم تعريف “القدرة العالية” من خلال النماذج التي تعمل على أتمتة العمليات السيبرانية الشاملة ضد أهداف محمية بشكل معقول أو اكتشاف/استغلال نقاط الضعف. أظهر الاختبار على تحديات Capture the Flag (CTF) وCVE-Bench أن GPT-5.6 Sol وLuna تجاوزا حد الاستعداد العالي في بعض السيناريوهات، حيث حقق Sol 97.06% في CTF. في عمليات محاكاة النطاق السيبراني، أظهر Sol نجاحًا أكبر من Luna، حيث قدم كلاهما تحديات في سيناريوهات محددة عالية التعقيد. لم يتم إجراء تقييمات التحسين الذاتي للذكاء الاصطناعي لأن GPT-5.6 Sol كان بالفعل أقل من مستوى السعة العالية. تهدف الضمانات المنفذة إلى إعاقة واكتشاف الأنشطة الهجومية المحظورة، مع الحفاظ على الاستخدامات الدفاعية والعلمية المشروعة لقدرات الأمن البيولوجي والسيبراني، وتعزيز الأمن عبر الإنترنت وخارجه.

انظر أيضاً