تطرح معظم معايير علم الأحياء أسئلة ضيقة قائمة على الحقائق مع إجابات واضحة. يزن العلماء الأدلة غير الكاملة ويتخذون القرارات. أصدرت OpenAI LifeSciBench وهي تستهدف هذه الفجوة مباشرة.
حتى أقوى النماذج ينجح في مهمة واحدة تقريبًا من كل ثلاث مهام. المعيار بعيد عن التشبع.
ما هو لايف سايبنش
يحتوي LifeSciBench على 750 مهمة من تأليف الخبراء. وهي تمتد على سبعة مسارات عمل وسبعة مجالات بيولوجية. تجمع كل مهمة بين عناصر مطالبة ودعمية وقاعدة تقييم.
تغطي مسارات العمل السبعة معالجة الأدلة وتحليلها. وتشمل أيضًا التصميم والتحسين، والتفكير العلمي، والتحقق والعمليات، والترجمة، والتواصل العلمي.
تمتد المجالات السبعة من علم الجينوم والكيمياء الطبية إلى العلوم السريرية والانتقالية.
تتم كتابة المهام كما يطلع العالم زميله. إنها استجابة حرة وليست اختيارات متعددة. ويتطلب حوالي 79% منهم خطوات متعددة للاستدلال أو اتخاذ القرار، بمتوسط أربع خطوات لكل منها.
كيف تم بناء المعيار
قامت مجموعة مكونة من 173 عالمًا خبيرًا بكتابة المهام. حصل كل منهم على درجة الدكتوراه. وكان لديه خبرة في مجال التكنولوجيا الحيوية أو الصيدلانية. بلغ متوسط المهام المقبولة ست دورات مراجعة آلية ومراجعتين على الأقل من الخبراء.
يتم شحن العديد من المهام مع القطع الأثرية. يتضمن المعيار 1062 قطعة أثرية مرفقة في المجموع. حوالي 53% من المهام تتطلب قطعة أثرية واحدة على الأقل. تتضمن الأنواع التسلسلات والأشكال والجداول وملفات PDF والهياكل الكيميائية.
مجموعة منفصلة التحقق من الجودة. كان هناك 453 مراجعًا، و97% منهم يحملون درجة الدكتوراه. تجاوز الاتفاق العام 96% فيما يتعلق بالأهمية والمنطق والأساس والفائدة.
النظام المعياري
قواعد التقييم هي الميكانيكي الأساسي هنا. أنها تحتوي على 19,020 معيارًا عبر المعيار. وهذا يعني ما يقرب من 25 معيارًا لكل مهمة.
يكافئ كل معيار خاصية ملموسة واحدة. تتضمن الأمثلة حقيقة محددة، أو خطوة تفكير، أو إجابة رقمية ضمن التسامح. يتم التقييم وفقًا لقواعد التقييم، وليس سلسلة مرجعية واحدة.
هناك مقياسان يلخصان الأداء. تقسم نقاط قاعدة التقييم المقيسة النقاط الممنوحة على إجمالي النقاط. يحسب معدل نجاح المهمة المهام التي سجلت نسبة 70% أو أكثر.
وهذا الفصل مهم للتفسير. يمكن أن تحصل الاستجابة على رصيد جزئي بينما لا تزال تفشل في المهمة. عتبة النجاح صارمة حسب التصميم.
هنا هو منطق التسجيل في بيثون عادي:
def grade(rubric, awarded_ids):
total = sum(c["pts"] for c in rubric)
earned = sum(c["pts"] for c in rubric if c["id"] in awarded_ids)
normalized = earned / total # partial credit
passed = normalized >= 0.70 # task-level success
return normalized, passed
كيفية أداء النماذج
قامت OpenAI بتقييم خمسة نماذج في إعداد دورة واحدة. شهد كل نموذج موجه والتحف مرة واحدة. تم السماح بتصفح الإنترنت غير المقيد.
| نموذج | النتيجة تطبيع | معدل نجاح المهمة |
|---|---|---|
| جي بي تي-روزاليند | 0.576 | 36.1% |
| جي بي تي-5.5 | 0.519 | 25.7% |
| الجوزاء 3.1 برو | 0.515 | 23.6% |
| جي بي تي-5.4 | 0.479 | 20.7% |
| جروك 4.3 | 0.399 | 13.0% |
GPT-Rosalind، نموذج OpenAI المتخصص في المجال، قاد بشكل عام. كان لديه أعلى متوسط لكل مهمة في 386 من 750 مهمة. كما أنه رفع معدل النجاح الإجمالي على GPT-5.5، من 25.7% إلى 36.1%. ظلت معدلات النجاح متواضعة في كل طراز.
التصنيفات ليست القصة بأكملها. Gemini 3.1 Pro قاد بشكل فريد 214 مهمة. يمكن أن تؤدي الدرجات الإجمالية إلى إخفاء نقاط القوة الخاصة بالمهمة.
حيث تفوز النماذج وأين تفشل
وكانت النماذج أقوى في الحكم المنظم. وصلت GPT-Rosalind إلى متوسط 0.712 في الترجمة. حصلت الاتصالات العلمية على 0.718، لكن تلك الفئة صغيرة، فاقرأها بحذر.
بقي اثنان من سير العمل صعبين. كان التصميم والتحسين والتنبؤ من بين أصعب الاختبارات، حيث تجاوزت نسبة GPT-Rosalind 30.7%. وكان التحليل قريبًا من 30.3٪.
كان استخدام القطع الأثرية بمثابة عنق الزجاجة الواضح. انخفضت نسبة GPT-Rosalind من 45.1% في المهام النصية فقط إلى 28.1% في المهام المصطنعة. وانخفضت نسبة GPT-5.5 بنفس الطريقة من 29.9% إلى 21.9%.
وكانت المخرجات الدقيقة هي الأصعب على الإطلاق. تراوح نجاح معيار التسلسل والهيكل من 46.9% إلى 18.0% عبر النماذج. كان كسب GPT-Rosalind على GPT-5.5 في عناصر الإنشاء/الإنشاء +0.001 فقط.
توقفت النماذج أيضًا في منتصف المهمة. بالنسبة إلى GPT-Rosalind، حصلت 109 مهمة على 50% على الأقل من درجات التقييم ولكنها لا تزال تتجاوز 20%.
الإرتفاع لا يزال كبيرا. لم ينجح أي نموذج في 171 مهمة (22.8%). وحصلت 261 مهمة (34.8%) على معدل نجاح للنموذج الأفضل أقل من 20%.
نقاط القوة والضعف
نقاط القوة:
- تغطية واسعة عبر سبعة مسارات عمل وسبعة مجالات بيولوجية
- نماذج تقييم من تأليف الخبراء تحتوي على 19,020 معيارًا ذريًا وقابلًا للتقدير
- التحف الواقعية: التسلسلات والأشكال والجداول وملفات PDF والهياكل
- التحقق المستقل من قبل 453 مراجعًا خبيرًا، 97% منهم حاصلون على درجة الدكتوراه
نقاط الضعف:
- دورة واحدة فقط؛ البحث الحقيقي هو تكراري ومتعدد المنعطفات
- تم إنشاؤه بواسطة OpenAI، والذي يوفر أيضًا النماذج الأكثر تقييمًا
- قد يكون الإصدار العام محدودًا بسبب قيود السلامة والترخيص
- 750 مهمة لا يمكن أن تغطي كل تخصص علمي
جربه: مصنف التقييم التفاعلي تجريبي
LifeSciBench — عرض توضيحي تفاعلي
مقياس التقييم ولوحة المتصدرين النموذجية
تعرف على كيفية عمل التقدير المستند إلى قواعد التقييم في مهمة قياس أداء حقيقية. قم بتبديل المعايير إلى نموذج “لقد نجح” وشاهد النتيجة الطبيعية وتحديث عتبة النجاح بنسبة 70% مباشرةً.
المهمة (التحليل – علم النسخ المكاني): باستخدام بيانات Visium المرفقة من شريحة سرطان عنق الرحم FFPE، قم بتجميع البقع في 4 مجموعات من الوسائل k، وقم بتعليق نوع الخلية السائدة لكل مجموعة، والتوصية بالعلاجات المستهدفة الواعدة 1-2 (ADC، TCE، أو CAR-T) بناءً على اختلافات تعبير المستضد بين مناطق الورم وغير الورم.
محاكاة الرد:
0 / 76 نقطة
النتيجة الطبيعية: 0%
▲ نسبة النجاح 70% (53.2 نقطة)
فشل – أقل من 70%
يمكن أن تجمع الاستجابة رصيدًا جزئيًا ولكنها لا تزال تفشل في المهمة. هذه الفجوة هي بالضبط ما يقيسه LifeSciBench.
تقييم دورة واحدة؛ يسمح بتصفح الإنترنت غير المقيد. قادت GPT-Rosalind بشكل عام ولكنها تصدرت بشكل فريد 386 مهمة فقط من أصل 750 مهمة؛ Gemini 3.1 Pro يقود بشكل فريد 214.
تحقق من ورق و التفاصيل الفنية. أيضا، لا تتردد في متابعتنا على تغريد ولا تنسى الانضمام إلينا 150 ألف + مل والاشتراك في النشرة الإخبارية لدينا. انتظر! هل أنت على برقية؟ الآن يمكنك الانضمام إلينا على التليجرام أيضًا.
هل تحتاج إلى الشراكة معنا للترويج لصفحة GitHub Repo أو صفحة الوجه المعانقة أو إصدار المنتج أو الندوة عبر الويب وما إلى ذلك؟ تواصل معنا
ميشال سوتر متخصص في علوم البيانات وحاصل على درجة الماجستير في علوم البيانات من جامعة بادوفا. بفضل أساس متين في التحليل الإحصائي والتعلم الآلي وهندسة البيانات، تتفوق ميشال في تحويل مجموعات البيانات المعقدة إلى رؤى قابلة للتنفيذ.
اكتشاف المزيد من كحيل | أخبار التقنية
اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.
