ما أطلقته xAI فعلياً
في 8 يوليو 2026، أطلقت xAI نموذج Grok 4.5، أول نموذج لديها مصمم خصيصاً للبرمجة والعمل الوكيلي بدلاً من المحادثة العامة. يأتي هذا الإطلاق في سوق نماذج متقدمة أصبح سلعياً بشكل متزايد، حيث تتجمع أفضل ثلاثة أو أربعة مختبرات ضمن فارق نقاط قليل في معظم المعايير — لذا اختارت xAI المنافسة على محور مختلف: عدد الرموز (tokens) التي يستهلكها النموذج للوصول إلى تلك النتيجة، وليس النتيجة وحدها.
في اختبار Terminal-Bench 2.1، وهو معيار وكيلي يقيّم قدرة النموذج على إنجاز مهام هندسة برمجيات حقيقية عبر سطر الأوامر من البداية للنهاية، حقق Grok 4.5 نسبة 83.3%، متفوقاً على Claude Opus 4.8 (max) من Anthropic الذي حقق 78.9%. أما في SWE-Bench Pro، وهو معيار أصعب يغطي مهام هندسة برمجيات كاملة، فقد أنجز Grok 4.5 نسبة 64.7% من المهام مقابل 69.2% لـ Opus 4.8 — معيار خسره Grok. لا يتصدر Grok 4.5 كل الترتيبات، وxAI لا تدّعي ذلك. ما تركز عليه الشركة بدلاً من ذلك هو التكلفة، بالرموز، للوصول إلى تلك النتيجة.
هذا هو الرقم المهم لكل من يدفع مقابل كل رمز: في SWE-Bench Pro، استخدم Grok 4.5 في المتوسط 15,954 رمزاً في الإخراج لكل مهمة، مقابل 67,020 رمزاً لـ Opus 4.8 (max) — فارق كفاءة يقارب 4.2 أضعاف، وفقاً لـتحليل apidog لبيانات المعايير التي نشرتها xAI. بعبارة أخرى، يستهلك Grok 4.5 نحو ربع رموز الإخراج التي يحتاجها Opus 4.8 لمحاولة إنجاز نفس فئة المهمة. وفي لوحة الترتيب المجمعة لـ BenchLM، يحصل Grok 4.5 على 76.72 من 100 إجمالاً — المرتبة السابعة من بين 200 نموذج مُتابَع، بنتيجة برمجة تبلغ 59.1 (المرتبة 25 من 122) ونتيجة وكيلية تبلغ 60.0 (المرتبة 12 من 119). لا شيء من هذه الترتيبات مبهر. فاتورة الرموز هي العرض الحقيقي.
الاقتصاد وراء ادعاء الكفاءة
تسعّر xAI الوصول إلى Grok 4.5 عبر API بـ2 دولار لكل مليون رمز إدخال و6 دولارات لكل مليون رمز إخراج، مع خصم على الإدخالات المخزنة مؤقتاً (cached) إلى 0.50 دولار لكل مليون. يأتي النموذج بنافذة سياق حجمها 500 ألف رمز — أصغر من نافذة المليون رمز في نموذج Grok 4.3 السابق لـ xAI، وهي مقايضة يبدو أن الشركة اختارتها لصالح تدريب مخصص للبرمجة بدلاً من سعة سياق أكبر. يشمل نظام التدريب هذا نموذج أساس “V9” بحجم 1.5 تريليون معامل (parameter)، أي ثلاثة أضعاف حجم جيل V8 السابق، وتم تدريبه بالتعاون مع Cursor، محرر الأكواد المصمم أصلاً للذكاء الاصطناعي، باستخدام مئات الآلاف من مهام هندسة البرمجيات متعددة الخطوات المستخلصة من جلسات مطورين حقيقية، وفقاً لـتقارير راصدي حوكمة الذكاء الاصطناعي عقب الإطلاق. جرى التدريب عبر عشرات الآلاف من وحدات معالجة الرسوميات NVIDIA GB300، ويُشغَّل النموذج في الإنتاج بمعدل يقارب 80 رمزاً في الثانية.
يمتد ادعاء الكفاءة إلى ما وراء مقارنات المعايير الفردية. في مهمة مركّبة لوكيل برمجة، استخدم Grok 4.5 1.9 مليون رمز إجمالاً مقابل 6.2 مليون لـ GPT-5.5 للوصول إلى أداء شبه مماثل — وهو ادعاء، إن ثبت تحت اختبار مستقل، يعني تقريباً نصف التكلفة الفعلية لتشغيل نفس سير العمل الوكيلي على نموذج OpenAI الحالي. تجدر الإشارة، وفقاً لتحليل apidog نفسه، إلى أنه حتى تاريخ نشر التحليل في 9 يوليو، لم يكن أي مختبر مستقل قد أعاد إنتاج هذه الأرقام — فالأرقام المتاحة حتى الآن تأتي من إصدار xAI نفسها ومن محللين يقرؤون الجداول التي نشرتها xAI، وليس من حملات معايير خارجية.
إعلان
معضلة الحوكمة في جلسات العمل الوكيلي الممتدة لساعات
يحمل تموضع Grok 4.5 كنموذج “وكيلي” — أي مصمم للعمل في جلسات ممتدة وغير خاضعة لإشراف كبير — تكلفة ثانية لا تظهرها جداول المعايير. يشير محللو حوكمة الذكاء الاصطناعي المتابعون لهذا الإطلاق إلى أن xAI صممت Grok 4.5 من أجل “جلسات عمل وكيلي تمتد لساعات”، مع تدريب مبني صراحةً على جلسات “تعمل باستمرار لساعات طويلة بينما يستمر التعلم بالتوازي”. تضع هذه القدرة النموذج فيما يصفه التحليل نفسه بـ”الفئة الأعلى خطورة ضمن أطر الحوكمة الناشئة للذكاء الاصطناعي الوكيلي” — الفئة التي تتطلب من المؤسسات توثيق آليات الإشراف البشري وأزرار الإيقاف الطارئ قبل النشر، لا بعده.
وعملياً، يحدد إطار الحوكمة خمسة ضوابط تتأثر مباشرة باعتماد نموذج مصمم لاستقلالية طويلة المدى: حدود نطاق واستقلالية مهام الوكيل، نقاط تحكم بشرية للإجراءات التي لا يمكن التراجع عنها، تقييمات جاهزية النشر الوكيلي، الامتثال في الأكواد المولّدة بالذكاء الاصطناعي وتراخيص المصادر المفتوحة، وبروتوكولات الإفصاح عن تحديثات نماذج المورّدين. لا يظهر أي من هذه العناصر في إصدار المعايير الذي نشرته xAI — بل تبرز فقط عندما يبدأ فريق الامتثال أو المخاطر بمقارنة النموذج بإطار حوكمة قائم.
ما يجب أن يفعله المديرون التقنيون في الشركات
1. حدد الميزانية وفق استهلاك الرموز، لا وفق تراخيص المستخدم الواحد
يقوم جوهر عرض Grok 4.5 على أن خفضاً بمقدار 4.2 أضعاف في رموز الإخراج لكل مهمة يغيّر اقتصاديات تشغيل وكلاء البرمجة على نطاق واسع — لكن هذا لا يظهر إلا إذا كانت جهة المشتريات تتابع التكلفة لكل مهمة منجزة بدلاً من سعر شهري ثابت لكل مستخدم. استخرج سجلات الرموز الفعلية من تجربة تجريبية قبل الالتزام بميزانية: تُظهر مقارنة apidog 15,954 رمزاً لكل مهمة SWE-Bench Pro لـ Grok 4.5 مقابل 67,020 لـ Opus 4.8، وتُظهر مقارنة felloai 1.9 مليون رمز لكل مهمة وكيل برمجة لـ Grok 4.5 مقابل 6.2 مليون لـ GPT-5.5. لا تأخذ أياً من هذين الرقمين كحقيقة مسلّمة — قِسهما مقابل حمل العمل الفعلي لديك قبل إعادة توزيع الإنفاق.
2. ضع حدوداً صريحة للاستقلالية قبل أول تشغيل ممتد لساعات
دربت xAI نموذج Grok 4.5 على جلسات تعمل باستمرار لساعات، وهو بالضبط النمط الذي تصنّفه أطر حوكمة الذكاء الاصطناعي الوكيلي الناشئة كأعلى خطورة. قبل السماح لأي فريق بتشغيل Grok 4.5 (أو وكيل مماثل طويل المدى) مقابل كود أو بنية تحتية في الإنتاج، حدد مدة تشغيل قصوى مسموح بها، وقائمة بفئات الإجراءات المسموحة، ونقطة تحكم بشرية لكل ما لا يمكن التراجع عنه — كالحذف، وعمليات النشر، وتغيير بيانات الاعتماد. تعديل هذه الضوابط بعد وقوع حادث أكثر تكلفة بكثير من تحديدها مسبقاً.
3. لا تُغيّر وكيل البرمجة بناءً على نتائج Terminal-Bench وحدها
يتفوق Grok 4.5 على Opus 4.8 في Terminal-Bench 2.1 (83.3% مقابل 78.9%) لكنه يخسر أمامه في SWE-Bench Pro (64.7% مقابل 69.2%) — معياران مختلفان يختبران مهارات مختلفة، دون أن يفوز أي نموذج في كليهما. اختر النموذج بناءً على توزيع المهام في المعيار الأقرب لقاعدة الكود وسير العمل الفعليين لديك، ولاحظ أنه حتى تاريخ النشر، لم يعد أي مختبر مستقل إنتاج أرقام xAI — تعامل مع المعايير المنشورة من الموردين كفلتر أولي للترشيح، لا كقرار نهائي.
4. تعامل مع نافذة السياق البالغة 500 ألف رمز كقيد حقيقي، لا كملاحظة هامشية
أطلقت xAI نموذج Grok 4.5 بنافذة سياق أصغر من سابقه — 500 ألف رمز مقابل مليون رمز في Grok 4.3 — وهي مقايضة متعمدة لصالح تدريب مخصص للبرمجة، وليست إغفالاً. بالنسبة للفرق التي تعمل على مستودعات كود ضخمة (monorepos) أو قواعد كود تتجاوز عادةً 500 ألف رمز من السياق ذي الصلة، يمثل هذا قيداً وظيفياً، لا تفصيلاً تسويقياً. اختبر النموذج مقابل مستودعك الفعلي أثناء التقييم، لا مقابل مستودع معيار اصطناعي.
أين يقع هذا في اقتصاد الوكلاء لعام 2026
يُعد Grok 4.5 أوضح إشارة حتى الآن على أن مختبرات الصدارة توقفت عن المنافسة على لوحات الدقة الخالصة وبدأت المنافسة على تكلفة تشغيل وكيل بشكل مستمر لساعات. يهم هذا التحول لأن أحمال العمل البرمجي الوكيلي لا تُنفَّذ مرة واحدة — بل تعمل في حلقات، وتعيد محاولة الخطوات الفاشلة، وتستهلك رموزاً في كل تكرار، ما يجعل فارقاً بمقدار 4.2 أضعاف في الرموز لكل مهمة يتراكم بسرعة عبر الاستخدام الفعلي لمؤسسة هندسية.
المعضلة أن أياً من أرقام كفاءة xAI لم يُتحقق منه بشكل مستقل، وأن نفس التصميم “يعمل لساعات دون إشراف” الذي يجعل Grok 4.5 فعّالاً هو ما يضعه أيضاً في الفئة الأعلى خطورة من الحوكمة وفق الأطر التي تتبناها الآن فرق الامتثال في الشركات. المشترون الذين يقيّمون Grok 4.5 مقابل Opus 4.8 أو GPT-5.5 يختارون فعلياً بين رهانين مختلفين: رهان على الدقة الخام في إنجاز المهام، ورهان على إنتاجية فعالة من حيث التكلفة مع فاتورة حوكمة مرفقة. لا أحد من الرهانين مجاني، وسيُحسم اقتصاد الوكلاء في 2026 بشكل متزايد وفق قدرة مؤسسة معينة على تفعيل أحد هذين المقايضتين فعلياً.
الأسئلة الشائعة
ما هو Grok 4.5 وكيف يختلف عن نماذج Grok السابقة؟
Grok 4.5 هو أول نموذج من xAI مصمم خصيصاً للبرمجة وسير العمل الوكيلي، أُطلق في 8 يوليو 2026. يعمل على نموذج أساس “V9” بحجم 1.5 تريليون معامل — أي ثلاثة أضعاف حجم جيل V8 السابق — وتم تدريبه بالتعاون مع محرر الأكواد Cursor على مئات الآلاف من مهام هندسة البرمجيات الحقيقية متعددة الخطوات، بدلاً من أن يكون نموذج محادثة عام تم تكييفه للبرمجة.
كيف تقارن كفاءة الرموز في Grok 4.5 مع Claude Opus 4.8؟
في SWE-Bench Pro، استخدم Grok 4.5 في المتوسط 15,954 رمزاً في الإخراج لكل مهمة مقابل 67,020 لـ Claude Opus 4.8 (max) — أي ميزة كفاءة تقارب 4.2 أضعاف، وفقاً لتحليل apidog لبيانات المعايير التي نشرتها xAI. ومع ذلك، لا يزال Grok 4.5 متأخراً عن Opus 4.8 في دقة SWE-Bench Pro (64.7% مقابل 69.2%)، لذا يأتي هذا المكسب في الكفاءة مع مقايضة طفيفة في الدقة على هذا المعيار تحديداً.
هل Grok 4.5 جاهز للاستخدام في الإنتاج ضمن خطوط أنابيب البرمجة المؤسسية؟
يمكن استخدامه عبر API اليوم بسعر 2 دولار لكل مليون رمز إدخال و6 دولارات لكل مليون رمز إخراج، لكن هناك تحفظين: لم يعد أي مختبر مستقل إنتاج أرقام معايير xAI حتى تقارير أسبوع 9 يوليو، كما أن تصميم النموذج لتشغيل مستقل يمتد لساعات يضعه في الفئة الأعلى خطورة ضمن أطر الحوكمة الناشئة للذكاء الاصطناعي الوكيلي — ما يعني أن النشر في الإنتاج ينبغي أن يترافق مع حدود استقلالية صريحة وضوابط بشرية، لا نشر شامل دون قيود.













