مقارنة نتائج GPT-6 Astra وFable 5.1 في اختبارات الأداء المنشورة
هاردوير

GPT-6 Astra وFable 5.1: المقارنة التي يتداولها الجميع تجمع اختبارين مختلفين

دقيقتان قراءة

الرقمان اللذان يقارنهما الناس هذه الأيام صحيحان كلاهما، والمشكلة أنّهما ليسا من الاختبار نفسه: 81.2 لـFable 5.1 على SWE-bench Pro، و74.1 لـGPT-6 Astra على DeepSWE v1.1.

اختباران مختلفان، وبيئتا تشغيل مختلفتان. وضعهما جنبًا إلى جنب لا يقول شيئًا.

الأرقام حين يكون الاختبار واحدًا

بالعودة إلى الجداول التي نشرتها OpenAI نفسها، والتي تضع النموذجين على الاختبار ذاته، تتغيّر الصورة:

  • DeepSWE v1.1: النتيجة 74.1% لـAstra مقابل 67.4% لـFable 5.1.
  • Terminal-Bench 4.0: النتيجة 57.7% مقابل 55.8%.
  • FrontierMath المستوى الرابع: النتيجة 97.6% مقابل 87.8%.
  • Terminal-Bench Science 0.1: النتيجة 64.6% مقابل 52.6%.
  • Agents’ Last Exam: النتيجة 59.3% مقابل 48.7%.
مقارنة نتائج GPT-6 Astra وFable 5.1 في اختبارات الأداء المنشورة
المصدر: OpenAI

أين يتقدّم Fable 5.1 فعلًا

التقدّم ليس وهمًا، لكنه في مواضع أخرى غير التي يذكرها العنوان المتداول:

  • Artificial Analysis Intelligence Index: النتيجة 65.7% لـFable 5.1 مقابل 61.2%.
  • Humanity’s Last Exam مع الأدوات: النتيجة 65.0% مقابل 57.2%.

والفارق في Terminal-Bench 4.0 أقلّ من نقطتين، وهو داخل هامش لا يُبنى عليه حكم.

ما قاله جنسن هوانج

رئيس NVIDIA التنفيذي جنسن هوانج هنّأ OpenAI علنًا على إطلاق GPT-6 Astra، ووصف ما يمثّله بأنه إيذان بعصر الذكاء العام الاصطناعي. وتشير التقارير إلى أنّ تكلفة تدريب النموذج بلغت نحو مليار دولار.

القاعدة التي تنفع عند قراءة أي جدول

اسم الاختبار جزء من الرقم لا زينة بجانبه. وحين تختلف الأسماء، لا مقارنة أصلًا، مهما بدا الرقمان قابلين للطرح.

عن النموذج نفسه، GPT-6 Astra ينقل الحمل إلى معالج جهازك. ومن الهاردوير المتّصل بهذا الملفّ، محطة AMD للذكاء الاصطناعي المحلي في وجه NVIDIA DGX، وخطوط سامسونج 4 نانومتر وHBM4، وأثر ذلك كلّه في أسعار الذاكرة.

الجداول الرسمية عبر OfficeChai، والقراءة المقارنة عبر Wccftech.