تخطَّ إلى المحتوى
منصة مصطفى ووردبريس
تحسين محركات البحث SEO

AI Benchmarks أسبوع 11 سبتمبر 2026: GPT-6 Astra وClaude Fable 5.1 يتصدران Index v4.3

تحليل أسبوعي لأهم تغيرات AI Benchmarks: تعادل GPT-6 Astra وClaude Fable 5.1 في Intelligence Index v4.3، مع فروق واضحة في التكلفة والكفاءة ونتائج Agentic/Coding، وشرح لماذا لا يجوز خلط نتائج الإعدادات المختلفة.

صورة بارزة لتقرير AI Benchmarks الأسبوعي في سبتمبر 2026 توضح GPT-6 Astra وClaude Fable 5.1 وتحديث Intelligence Index v4.3

الخلاصة: أهم تغير هذا الأسبوع ليس أن هناك «نموذجًا فائزًا مطلقًا»، بل أن GPT-6 Astra وClaude Fable 5.1 أصبحا متعادلين عند 53 نقطة على Artificial Analysis Intelligence Index v4.3، بينما يختلفان بوضوح في التكلفة، استهلاك التوكنات، وبعض اختبارات العمل الوكيلي والبرمجة. التحديث نفسه مهم أيضًا لأن Artificial Analysis غيّرت منهجية المؤشر: رفعت Terminal-Bench إلى v4.0 واستبدلت اختبارًا سابقًا بـ AutomationBench-AA ذي مجموعة اختبار خاصة.

لذلك، أي مقارنة مباشرة بين أرقام v4.3 وإصدارات أقدم من المؤشر يجب أن تُعامل بحذر. تغير الـBenchmark نفسه قد يغير الترتيب حتى لو لم يتغير النموذج.

ما الذي تغيّر هذا الأسبوع في AI Benchmarks؟

في 7 سبتمبر 2026 أعلنت Artificial Analysis الإصدار Intelligence Index v4.3. المؤشر الجديد يضم 10 تقييمات موزعة بين Agents وCoding وGeneral وScientific Reasoning، مع بقاء أوزان الفئات عند 30% للوكلاء، 20% للبرمجة، 30% للقدرات العامة، و20% للاستدلال العلمي.

إنفوجرافيك يوضح تحديث Artificial Analysis Intelligence Index v4.3 وإضافة AutomationBench-AA وترقية Terminal-Bench إلى الإصدار 4.0
Intelligence Index v4.3 غيّر جزءًا من منهجية القياس؛ لذلك لا يجب مساواة أرقامه بإصدارات أقدم دون مراجعة الإعداد.

أبرز تعديلين هما:

  • Terminal-Bench v4.0 بدل v2.1، مع مهام أصعب وتغييرات في الوقت والحوسبة وبيئة التنفيذ والتحقق. Artificial Analysis تشغّل 66 مهمة ثلاث مرات وتعرض متوسط pass@1.
  • AutomationBench-AA بدل τ³-Banking، بالتعاون مع Zapier، على مجموعة خاصة من 657 مهمة تغطي Finance وHR وMarketing وOperations وSales وSupport.

كما ارتفع وزن الاختبارات ذات الأسئلة أو الإجابات الخاصة من 40% إلى 45%، وهو اتجاه مهم لتقليل احتمالية التدريب المباشر على أسئلة الاختبار.

الترتيب الحالي في Intelligence Index v4.3

النموذجالإعدادالنتيجةملاحظة
GPT-6 Astramax53تعادل في الصدارة
Claude Fable 5.1max + fallback53تعادل في الصدارة
Claude Opus 5max51خلف القمة بنقطتين
Claude Fable 5with fallback50أقل من 5.1 بثلاث نقاط
Muse Spark 1.3max48ضمن المجموعة الأمامية
GPT-5.6 Solmax47Astra يتقدم عليه 6 نقاط

هذه ليست «مسابقة ذكاء عامة» بالمعنى المطلق. المؤشر مركب من عدة اختبارات وبأوزان محددة، لذلك الأفضل قراءة النتيجة كإشارة إلى الأداء عبر هذا المزيج من المهام تحديدًا.

Agentic Tasks: أين يظهر الفارق الحقيقي؟

أقوى إشارة هذا الأسبوع جاءت من الاختبارات الوكيلية الجديدة. في AutomationBench-AA v1.0.6، تُقاس نسبة الأهداف المكتملة، وأي خرق للـguardrails يجعل درجة المهمة صفرًا.

النموذجAutomationBench-AA Scoreإكمال المهمة بالكامل بلا مخالفة
GPT-6 Astra (max)68.5%41.6%
Grok 4.6 (high)66.7%
GLM-5.3 (max)62.2%
Claude Fable 5.1 (max + fallback)32.1%
Claude Opus 5 (max)28.3%

المهم هنا هو التفريق بين Score وTasks Completed. الأول يسمح بالـpartial credit، أما الثاني فيتطلب إكمال كل الأهداف بلا أي guardrail violation. الخلط بين الرقمين يعطي انطباعًا مضللًا.

Coding: Terminal-Bench v4.0 غيّر الصورة

في النسخة المستقلة التي شغلتها Artificial Analysis على Terminal-Bench v4.0، سجل GPT-6 Astra max نسبة 59.1%، مقابل 52.0% لـClaude Fable 5.1 max with fallback، و49.0% لـClaude Opus 5، و39.9% لـGPT-5.6 Sol.

لكن هنا توجد نقطة منهجية مهمة: صفحة OpenAI الرسمية لـGPT-6 Astra تعرض 57.9% على Terminal-Bench 4.0، وليس 59.1%. الاختلاف لا يعني أن أحد المصدرين «خاطئ»؛ بل يعني أن harness والإعداد والتنفيذ قد يختلفان. لذلك نستخدم كل نتيجة داخل سياق مصدرها ولا نخلطها في جدول Apples-to-Apples.

في Artificial Analysis Coding Agent Index، يتعادل GPT-6 Astra في Codex مع Claude Fable 5.1 في Claude Code عند 62، ثم Claude Opus 5 عند 60، وGPT-5.6 Sol عند 55، وMuse Spark 1.3 في Muse Code عند 54. هذا المؤشر لا يقيس «النموذج الخام» فقط؛ بل النموذج داخل agent harness محدد.

الكفاءة والتكلفة: نفس الدرجة لا تعني نفس الاقتصاد

التعادل عند 53 يخفي فرقًا اقتصاديًا كبيرًا. بحسب Artificial Analysis، متوسط تكلفة المهمة في Intelligence Index يبلغ $3.26 لـGPT-6 Astra max مقابل $7.63 لـClaude Fable 5.1 max with fallback؛ أي أقل بنحو 57% لأسترا ضمن هذه المنهجية.

كما أن Astra يستخدم نحو 27 ألف output token لكل مهمة عند max مقابل نحو 78 ألفًا لـFable 5.1 في الإعداد المقارن داخل المؤشر. هذه الكفاءة تفسر جزءًا من فارق التكلفة، رغم أن سعر Astra لكل مليون token أعلى من GPT-5.6 Sol.

Reasoning وKnowledge Work: لا يوجد فائز موحد

التفصيل الداخلي للمؤشر يوضح لماذا لا يصح اختزال النتيجة في لقب «الأفضل». Claude Fable 5.1 يتقدم في AA-Briefcase وSciCode، بينما GPT-6 Astra يتقدم في Terminal-Bench v4.0 وAutomationBench-AA.

وبحسب Artificial Analysis، تحسن Astra بنحو 90 Elo في AA-Briefcase مقارنة بـGPT-5.6 Sol، لكنه تراجع في Presentation Quality Elo. كما انخفض أداؤه بنحو 45 Elo في GDPval-AA v2 مقارنة بسلفه، مع استخدام عدد أقل بكثير من turns. هذه المقايضات مهمة عند اختيار نموذج للعمل الحقيقي.

Multimodal: لماذا لا أدمج لوحات الصور مع Intelligence Index؟

لوحات الصور والتحرير البصري تقيس شيئًا مختلفًا تمامًا عن الاستدلال النصي أو العمل الوكيلي. على لوحة Artificial Analysis Image Editing الحالية، تتصدر MAI-Image-2.6، بينما تظهر GPT Image 2 وMuse Image وNano Banana 2 ضمن المراتب العليا. هذه النتائج مبنية على Elo وتفضيلات بشرية لعينة صور، وليست قابلة للدمج مع Intelligence Index في «درجة ذكاء» واحدة.

كذلك أعلنت Google عن Gemini 3.8 Flash مع تحسينات في software engineering والمهام الوكيلية والاستدلال متعدد الخطوات، لكن المقارنة الرسمية داخل صفحة الإطلاق ليست بديلًا عن اختبار مستقل موحد الإعداد. لذلك لا نمنح Gemini 3.8 رتبة عامة بناءً على claims الشركة وحدها.

إنفوجرافيك يشرح شروط المقارنة العادلة بين نماذج الذكاء الاصطناعي في Benchmarks مثل توحيد الإصدار وreasoning effort والأدوات وبيئة التنفيذ
المقارنة العادلة تتطلب تثبيت إصدار الاختبار، reasoning effort، الأدوات، prompting وبيئة التنفيذ.

كيف تقرأ أي Benchmark بدون الوقوع في استنتاجات مضللة؟

  1. ثبّت إصدار Benchmark. Terminal-Bench v2.1 ليس هو v4.0.
  2. راجع reasoning effort. low وmedium وhigh وmax ليست إعدادًا واحدًا.
  3. راجع الأدوات والـharness. Codex وClaude Code وبيئة مستقلة قد تغير النتيجة.
  4. افصل partial score عن full task completion. خصوصًا في AutomationBench-AA.
  5. قارن التكلفة لكل مهمة، لا سعر التوكن فقط. نموذج أغلى لكل token قد يستهلك عددًا أقل بكثير.
  6. لا تخلط اختبارات الشركات مع الاختبارات المستقلة. استخدمها كمصادر مكملة لا كجدول واحد.

ماذا يعني ذلك عمليًا للمطور وصاحب العمل؟

إذا كان هدفك agentic automation أو تشغيل مهام طويلة متعددة الخطوات، فالإشارة الحالية قوية لصالح GPT-6 Astra وClaude Fable 5.1، لكن الاختيار لا يتوقف على الدرجة. Astra يبدو أكثر كفاءة من ناحية cost-per-task في بيانات Artificial Analysis، بينما Fable 5.1 يحتفظ بقوة واضحة في بعض مهام المعرفة والعلوم.

أما للبرمجة، فراجع Coding Agent Index وبيئة الأداة التي ستستخدمها فعليًا. نتيجة النموذج داخل Codex لا تعني بالضرورة النتيجة نفسها داخل Claude Code أو harness داخلي.

للمزيد عن أحد النموذجين المتصدرين، راجع تحليلنا لـClaude Fable 5.1. ولصورة أوسع عن اختلاف المنتجات والاستخدامات، راجع Gemini vs ChatGPT في 2026.

المصادر والمنهجية

الأسئلة الشائعة

هل GPT-6 Astra هو أفضل نموذج حاليًا؟

لا يمكن إثبات ذلك من Benchmark واحد. هو متعادل في صدارة Intelligence Index v4.3 وCoding Agent Index وفق إعدادات Artificial Analysis، لكن نماذج أخرى تتقدم في اختبارات فرعية مختلفة.

لماذا لا نقارن نتائج OpenAI الرسمية مباشرة بنتائج Artificial Analysis؟

لأن الـharness والأدوات وreasoning effort وبيئة التنفيذ وطريقة احتساب النتيجة قد تختلف. مثال واضح: Terminal-Bench 4.0 يظهر 57.9% في صفحة OpenAI الرسمية و59.1% في تشغيل Artificial Analysis المستقل.

هل انخفاض التكلفة لكل مهمة يعني أن النموذج أرخص دائمًا؟

لا. Cost per Task في المؤشر يعتمد على نمط استخدام محدد وتوزيع مهام محدد، وقد تختلف التكلفة في تطبيقك حسب طول السياق، caching، عدد turns والأدوات.

قال المدير التنفيذي للمنصة

مصطفى زكي، مؤسس منصة مصطفى ووردبريس (Mustafa-WP)، ومتخصص في تطوير وتحسين مواقع WordPress وWooCommerce، السيو التقني (Technical SEO)، تحسين السرعة والأداء، الأمان وحل المشكلات التقنية. يركز على بناء مواقع عملية وسريعة وقابلة للتوسع، وتقديم شروحات وتجارب تطبيقية تساعد أصحاب المواقع والمتاجر على تحسين الظهور في محركات البحث ورفع جودة تجربة المستخدم وإدارة مواقعهم بكفاءة.

WordPress WooCommerce Technical SEO الأداء والأمان

أضف تعليقاً

لن يتم نشر عنوان بريدك الإلكتروني. الحقول الإلزامية مشار إليها بـ *

اقرأ أيضاً

مقالات ذات صلة

تواصل واتساب