نشرت OpenAI طريقة جديدة لسلامة ما قبل النشر تسمى Deployment Simulation. الفكرة مباشرة. قبل شحن النموذج، قم بمحاكاة نشره أولاً. إعادة تشغيل المحادثات السابقة من خلال نموذج المرشح الجديد. ثم ادرس كيف يتصرف في سياقات واقعية.

يستخدم OpenAI بالفعل رؤى من الطريقة أثناء تطوير النموذج. وقد أبلغت قرارات التخفيف والنشر، وظهرت نقاط عمياء في التقييمات التقليدية.

https://cdn.openai.com/pdf/predicting-llm-safety-before-release-by-simulator-deployment.pdf

فهم محاكاة النشر

تعد محاكاة النشر طريقة لمحاكاة النشر المستقبلي قبل حدوثه. يقوم OpenAI بذلك عن طريق إعادة تشغيل المحادثات السابقة باستخدام نموذج مرشح جديد. الإعادة هي الحفاظ على الخصوصية.

هذه التقنية بسيطة في جوهرها. خذ المحادثات الأخيرة من النشر. قم بإزالة استجابة المساعد الأصلية من النموذج الأقدم. قم بإعادة إنشاء تلك الاستجابة باستخدام النموذج المرشح الذي سيتم إصداره. ثم قم بتقييم الإكمالات لأنماط الفشل الجديدة.

ومن خلال تلك الإكمالات، تقوم OpenAI بتقدير تكرار السلوك غير المرغوب فيه في وقت النشر. يمكن تشغيل نفس القياس بعد الإصدار على حركة المرور الحقيقية. وهذا يجعل توقعات ما قبل النشر قابلة للتحقق لاحقًا.

هناك أرضية. لا يمكن لهذا الأسلوب قياس السلوكيات التي تحدث أقل من مرة واحدة في 200000 رسالة. وهو يستهدف المخاطر غير التيلية، وليس الأحداث النادرة.