الخلاصة: أهم تغير هذا الأسبوع ليس أن هناك «نموذجًا فائزًا مطلقًا»، بل أن GPT-6 Astra وClaude Fable 5.1 أصبحا متعادلين عند 53 نقطة على Artificial Analysis Intelligence Index v4.3، بينما يختلفان بوضوح في التكلفة، استهلاك التوكنات، وبعض اختبارات العمل الوكيلي والبرمجة. التحديث نفسه مهم أيضًا لأن Artificial Analysis غيّرت منهجية المؤشر: رفعت Terminal-Bench إلى v4.0 واستبدلت اختبارًا سابقًا بـ AutomationBench-AA ذي مجموعة اختبار خاصة.
لذلك، أي مقارنة مباشرة بين أرقام v4.3 وإصدارات أقدم من المؤشر يجب أن تُعامل بحذر. تغير الـBenchmark نفسه قد يغير الترتيب حتى لو لم يتغير النموذج.
ما الذي تغيّر هذا الأسبوع في AI Benchmarks؟
في 7 سبتمبر 2026 أعلنت Artificial Analysis الإصدار Intelligence Index v4.3. المؤشر الجديد يضم 10 تقييمات موزعة بين Agents وCoding وGeneral وScientific Reasoning، مع بقاء أوزان الفئات عند 30% للوكلاء، 20% للبرمجة، 30% للقدرات العامة، و20% للاستدلال العلمي.

أبرز تعديلين هما:
- Terminal-Bench v4.0 بدل v2.1، مع مهام أصعب وتغييرات في الوقت والحوسبة وبيئة التنفيذ والتحقق. Artificial Analysis تشغّل 66 مهمة ثلاث مرات وتعرض متوسط pass@1.
- AutomationBench-AA بدل τ³-Banking، بالتعاون مع Zapier، على مجموعة خاصة من 657 مهمة تغطي Finance وHR وMarketing وOperations وSales وSupport.
كما ارتفع وزن الاختبارات ذات الأسئلة أو الإجابات الخاصة من 40% إلى 45%، وهو اتجاه مهم لتقليل احتمالية التدريب المباشر على أسئلة الاختبار.
الترتيب الحالي في Intelligence Index v4.3
| النموذج | الإعداد | النتيجة | ملاحظة |
|---|---|---|---|
| GPT-6 Astra | max | 53 | تعادل في الصدارة |
| Claude Fable 5.1 | max + fallback | 53 | تعادل في الصدارة |
| Claude Opus 5 | max | 51 | خلف القمة بنقطتين |
| Claude Fable 5 | with fallback | 50 | أقل من 5.1 بثلاث نقاط |
| Muse Spark 1.3 | max | 48 | ضمن المجموعة الأمامية |
| GPT-5.6 Sol | max | 47 | Astra يتقدم عليه 6 نقاط |
هذه ليست «مسابقة ذكاء عامة» بالمعنى المطلق. المؤشر مركب من عدة اختبارات وبأوزان محددة، لذلك الأفضل قراءة النتيجة كإشارة إلى الأداء عبر هذا المزيج من المهام تحديدًا.
Agentic Tasks: أين يظهر الفارق الحقيقي؟
أقوى إشارة هذا الأسبوع جاءت من الاختبارات الوكيلية الجديدة. في AutomationBench-AA v1.0.6، تُقاس نسبة الأهداف المكتملة، وأي خرق للـguardrails يجعل درجة المهمة صفرًا.
| النموذج | AutomationBench-AA Score | إكمال المهمة بالكامل بلا مخالفة |
|---|---|---|
| GPT-6 Astra (max) | 68.5% | 41.6% |
| Grok 4.6 (high) | 66.7% | — |
| GLM-5.3 (max) | 62.2% | — |
| Claude Fable 5.1 (max + fallback) | — | 32.1% |
| Claude Opus 5 (max) | — | 28.3% |
المهم هنا هو التفريق بين Score وTasks Completed. الأول يسمح بالـpartial credit، أما الثاني فيتطلب إكمال كل الأهداف بلا أي guardrail violation. الخلط بين الرقمين يعطي انطباعًا مضللًا.
Coding: Terminal-Bench v4.0 غيّر الصورة
في النسخة المستقلة التي شغلتها Artificial Analysis على Terminal-Bench v4.0، سجل GPT-6 Astra max نسبة 59.1%، مقابل 52.0% لـClaude Fable 5.1 max with fallback، و49.0% لـClaude Opus 5، و39.9% لـGPT-5.6 Sol.
لكن هنا توجد نقطة منهجية مهمة: صفحة OpenAI الرسمية لـGPT-6 Astra تعرض 57.9% على Terminal-Bench 4.0، وليس 59.1%. الاختلاف لا يعني أن أحد المصدرين «خاطئ»؛ بل يعني أن harness والإعداد والتنفيذ قد يختلفان. لذلك نستخدم كل نتيجة داخل سياق مصدرها ولا نخلطها في جدول Apples-to-Apples.
في Artificial Analysis Coding Agent Index، يتعادل GPT-6 Astra في Codex مع Claude Fable 5.1 في Claude Code عند 62، ثم Claude Opus 5 عند 60، وGPT-5.6 Sol عند 55، وMuse Spark 1.3 في Muse Code عند 54. هذا المؤشر لا يقيس «النموذج الخام» فقط؛ بل النموذج داخل agent harness محدد.
الكفاءة والتكلفة: نفس الدرجة لا تعني نفس الاقتصاد
التعادل عند 53 يخفي فرقًا اقتصاديًا كبيرًا. بحسب Artificial Analysis، متوسط تكلفة المهمة في Intelligence Index يبلغ $3.26 لـGPT-6 Astra max مقابل $7.63 لـClaude Fable 5.1 max with fallback؛ أي أقل بنحو 57% لأسترا ضمن هذه المنهجية.
كما أن Astra يستخدم نحو 27 ألف output token لكل مهمة عند max مقابل نحو 78 ألفًا لـFable 5.1 في الإعداد المقارن داخل المؤشر. هذه الكفاءة تفسر جزءًا من فارق التكلفة، رغم أن سعر Astra لكل مليون token أعلى من GPT-5.6 Sol.
Reasoning وKnowledge Work: لا يوجد فائز موحد
التفصيل الداخلي للمؤشر يوضح لماذا لا يصح اختزال النتيجة في لقب «الأفضل». Claude Fable 5.1 يتقدم في AA-Briefcase وSciCode، بينما GPT-6 Astra يتقدم في Terminal-Bench v4.0 وAutomationBench-AA.
وبحسب Artificial Analysis، تحسن Astra بنحو 90 Elo في AA-Briefcase مقارنة بـGPT-5.6 Sol، لكنه تراجع في Presentation Quality Elo. كما انخفض أداؤه بنحو 45 Elo في GDPval-AA v2 مقارنة بسلفه، مع استخدام عدد أقل بكثير من turns. هذه المقايضات مهمة عند اختيار نموذج للعمل الحقيقي.
Multimodal: لماذا لا أدمج لوحات الصور مع Intelligence Index؟
لوحات الصور والتحرير البصري تقيس شيئًا مختلفًا تمامًا عن الاستدلال النصي أو العمل الوكيلي. على لوحة Artificial Analysis Image Editing الحالية، تتصدر MAI-Image-2.6، بينما تظهر GPT Image 2 وMuse Image وNano Banana 2 ضمن المراتب العليا. هذه النتائج مبنية على Elo وتفضيلات بشرية لعينة صور، وليست قابلة للدمج مع Intelligence Index في «درجة ذكاء» واحدة.
كذلك أعلنت Google عن Gemini 3.8 Flash مع تحسينات في software engineering والمهام الوكيلية والاستدلال متعدد الخطوات، لكن المقارنة الرسمية داخل صفحة الإطلاق ليست بديلًا عن اختبار مستقل موحد الإعداد. لذلك لا نمنح Gemini 3.8 رتبة عامة بناءً على claims الشركة وحدها.

كيف تقرأ أي Benchmark بدون الوقوع في استنتاجات مضللة؟
- ثبّت إصدار Benchmark. Terminal-Bench v2.1 ليس هو v4.0.
- راجع reasoning effort. low وmedium وhigh وmax ليست إعدادًا واحدًا.
- راجع الأدوات والـharness. Codex وClaude Code وبيئة مستقلة قد تغير النتيجة.
- افصل partial score عن full task completion. خصوصًا في AutomationBench-AA.
- قارن التكلفة لكل مهمة، لا سعر التوكن فقط. نموذج أغلى لكل token قد يستهلك عددًا أقل بكثير.
- لا تخلط اختبارات الشركات مع الاختبارات المستقلة. استخدمها كمصادر مكملة لا كجدول واحد.
ماذا يعني ذلك عمليًا للمطور وصاحب العمل؟
إذا كان هدفك agentic automation أو تشغيل مهام طويلة متعددة الخطوات، فالإشارة الحالية قوية لصالح GPT-6 Astra وClaude Fable 5.1، لكن الاختيار لا يتوقف على الدرجة. Astra يبدو أكثر كفاءة من ناحية cost-per-task في بيانات Artificial Analysis، بينما Fable 5.1 يحتفظ بقوة واضحة في بعض مهام المعرفة والعلوم.
أما للبرمجة، فراجع Coding Agent Index وبيئة الأداة التي ستستخدمها فعليًا. نتيجة النموذج داخل Codex لا تعني بالضرورة النتيجة نفسها داخل Claude Code أو harness داخلي.
للمزيد عن أحد النموذجين المتصدرين، راجع تحليلنا لـClaude Fable 5.1. ولصورة أوسع عن اختلاف المنتجات والاستخدامات، راجع Gemini vs ChatGPT في 2026.
المصادر والمنهجية
- Artificial Analysis Intelligence Index v4.3 — المنهجية والنتائج المستقلة.
- Artificial Analysis: Benchmarking GPT-6 Astra — تفاصيل التكلفة والكفاءة وCoding Agent Index.
- OpenAI: GPT-6 Astra — النتائج الرسمية وإعدادات الشركة.
- Google DeepMind: Gemini 3.8 Flash — إعلان النموذج الرسمي.
الأسئلة الشائعة
هل GPT-6 Astra هو أفضل نموذج حاليًا؟
لا يمكن إثبات ذلك من Benchmark واحد. هو متعادل في صدارة Intelligence Index v4.3 وCoding Agent Index وفق إعدادات Artificial Analysis، لكن نماذج أخرى تتقدم في اختبارات فرعية مختلفة.
لماذا لا نقارن نتائج OpenAI الرسمية مباشرة بنتائج Artificial Analysis؟
لأن الـharness والأدوات وreasoning effort وبيئة التنفيذ وطريقة احتساب النتيجة قد تختلف. مثال واضح: Terminal-Bench 4.0 يظهر 57.9% في صفحة OpenAI الرسمية و59.1% في تشغيل Artificial Analysis المستقل.
هل انخفاض التكلفة لكل مهمة يعني أن النموذج أرخص دائمًا؟
لا. Cost per Task في المؤشر يعتمد على نمط استخدام محدد وتوزيع مهام محدد، وقد تختلف التكلفة في تطبيقك حسب طول السياق، caching، عدد turns والأدوات.

