⚡ أبرز النقاط

أطلقت xAI نموذج Grok 4.5 في 8 يوليو 2026، محققاً 83.3% في اختبار Terminal-Bench 2.1 باستخدام متوسط 15,954 رمزاً في الإخراج لكل مهمة SWE-Bench Pro، مقابل 67,020 رمزاً لـ Claude Opus 4.8 — أي ما يقارب ربع استهلاك الرموز. لا يزال النموذج متأخراً عن Opus 4.8 في دقة SWE-Bench Pro (64.7% مقابل 69.2%)، ولم يُتحقق بعد من ادعاءات الكفاءة بشكل مستقل.

الخلاصة: ينبغي على قادة الهندسة في الشركات اختبار Grok 4.5 مقابل ميزانيات الرموز وقواعد الأكواد الخاصة بهم بدلاً من الثقة بالمعايير المنشورة من المورّد، وربط أي تشغيل وكيلي يمتد لساعات بحدود استقلالية صريحة وضوابط بشرية.

اقرأ التحليل الكامل ↓

🧭 رادار القرار

Relevance for Algeria
متوسطة

فرق البرمجيات الجزائرية التي تستخدم بالفعل مساعدي برمجة بالذكاء الاصطناعي (Cursor، أدوات شبيهة بـCopilot) ستطّلع على Grok 4.5 بشكل أساسي عبر تكاملات محررات أكواد من طرف ثالث بدلاً من اعتماد مباشر، لأن xAI ليس لديها حضور محلي أو قنوات فوترة في الجزائر.
Infrastructure Ready?
جزئية

يُتاح Grok 4.5 عبر API، ما لا يتطلب أي بنية تحتية محلية لوحدات معالجة الرسوميات — القيد يكمن في الوصول الموثوق منخفض الكمون إلى الإنترنت وقنوات الدفع من الدينار إلى الدولار لفوترة الـAPI، وكلاهما لا يزال غير مستقر بالنسبة لشركات التطوير الجزائرية الصغيرة.
Skills Available?
محدودة

تمتلك الجزائر مجموعة متنامية من مهندسي البرمجيات الذين يستخدمون أدوات البرمجة بالذكاء الاصطناعي يومياً، لكن قلة قليلة من الفرق تمتلك النضج التشغيلي الوكيلي (مراقبة التشغيل، آليات الإيقاف الطارئ، تتبع ميزانية الرموز) الذي يتطلبه فعلياً وكيل برمجة مستقل يعمل لساعات.
Action Timeline
12-24 شهراً

ينبغي على فرق الهندسة الجزائرية اعتبار هذه فترة “مراقبة وتجربة محدودة” بدلاً من انتقال فوري — فغياب التحقق المستقل من المعايير وعبء الحوكمة يبرران انتظار بيانات اعتماد فعلية من الواقع.
Key Stakeholders
المديرون التقنيون، قادة الهندسة، فرق DevOps/المنصات، مؤسسو الشركات الناشئة
Decision Type
تعليمي

يشرح هذا المقال تحولاً في المعايير والتسعير في سوق وكلاء البرمجة بدلاً من أن يفرض قرار شراء فوري — معظم الفرق الجزائرية ليست بعد في موقع يسمح لها بالتصرف مباشرة بناءً عليه.

خلاصة سريعة: ينبغي على فرق الهندسة الجزائرية التي تقيّم وكلاء البرمجة بالذكاء الاصطناعي اختبار Grok 4.5 مقابل مستودعات أكوادها وميزانيات الرموز الخاصة بها بدلاً من الوثوق بالمعايير التي نشرتها xAI دون تحقق، وينبغي أن تقرن أي تشغيل وكيلي يمتد لساعات بحدود استقلالية صريحة ونقاط تحكم بشرية قبل لمس أنظمة الإنتاج.

إعلان

ما أطلقته xAI فعلياً

في 8 يوليو 2026، أطلقت xAI نموذج Grok 4.5، أول نموذج لديها مصمم خصيصاً للبرمجة والعمل الوكيلي بدلاً من المحادثة العامة. يأتي هذا الإطلاق في سوق نماذج متقدمة أصبح سلعياً بشكل متزايد، حيث تتجمع أفضل ثلاثة أو أربعة مختبرات ضمن فارق نقاط قليل في معظم المعايير — لذا اختارت xAI المنافسة على محور مختلف: عدد الرموز (tokens) التي يستهلكها النموذج للوصول إلى تلك النتيجة، وليس النتيجة وحدها.

في اختبار Terminal-Bench 2.1، وهو معيار وكيلي يقيّم قدرة النموذج على إنجاز مهام هندسة برمجيات حقيقية عبر سطر الأوامر من البداية للنهاية، حقق Grok 4.5 نسبة 83.3%، متفوقاً على Claude Opus 4.8 (max) من Anthropic الذي حقق 78.9%. أما في SWE-Bench Pro، وهو معيار أصعب يغطي مهام هندسة برمجيات كاملة، فقد أنجز Grok 4.5 نسبة 64.7% من المهام مقابل 69.2% لـ Opus 4.8 — معيار خسره Grok. لا يتصدر Grok 4.5 كل الترتيبات، وxAI لا تدّعي ذلك. ما تركز عليه الشركة بدلاً من ذلك هو التكلفة، بالرموز، للوصول إلى تلك النتيجة.

هذا هو الرقم المهم لكل من يدفع مقابل كل رمز: في SWE-Bench Pro، استخدم Grok 4.5 في المتوسط 15,954 رمزاً في الإخراج لكل مهمة، مقابل 67,020 رمزاً لـ Opus 4.8 (max) — فارق كفاءة يقارب 4.2 أضعاف، وفقاً لـتحليل apidog لبيانات المعايير التي نشرتها xAI. بعبارة أخرى، يستهلك Grok 4.5 نحو ربع رموز الإخراج التي يحتاجها Opus 4.8 لمحاولة إنجاز نفس فئة المهمة. وفي لوحة الترتيب المجمعة لـ BenchLM، يحصل Grok 4.5 على 76.72 من 100 إجمالاً — المرتبة السابعة من بين 200 نموذج مُتابَع، بنتيجة برمجة تبلغ 59.1 (المرتبة 25 من 122) ونتيجة وكيلية تبلغ 60.0 (المرتبة 12 من 119). لا شيء من هذه الترتيبات مبهر. فاتورة الرموز هي العرض الحقيقي.

الاقتصاد وراء ادعاء الكفاءة

تسعّر xAI الوصول إلى Grok 4.5 عبر API بـ2 دولار لكل مليون رمز إدخال و6 دولارات لكل مليون رمز إخراج، مع خصم على الإدخالات المخزنة مؤقتاً (cached) إلى 0.50 دولار لكل مليون. يأتي النموذج بنافذة سياق حجمها 500 ألف رمز — أصغر من نافذة المليون رمز في نموذج Grok 4.3 السابق لـ xAI، وهي مقايضة يبدو أن الشركة اختارتها لصالح تدريب مخصص للبرمجة بدلاً من سعة سياق أكبر. يشمل نظام التدريب هذا نموذج أساس “V9” بحجم 1.5 تريليون معامل (parameter)، أي ثلاثة أضعاف حجم جيل V8 السابق، وتم تدريبه بالتعاون مع Cursor، محرر الأكواد المصمم أصلاً للذكاء الاصطناعي، باستخدام مئات الآلاف من مهام هندسة البرمجيات متعددة الخطوات المستخلصة من جلسات مطورين حقيقية، وفقاً لـتقارير راصدي حوكمة الذكاء الاصطناعي عقب الإطلاق. جرى التدريب عبر عشرات الآلاف من وحدات معالجة الرسوميات NVIDIA GB300، ويُشغَّل النموذج في الإنتاج بمعدل يقارب 80 رمزاً في الثانية.

يمتد ادعاء الكفاءة إلى ما وراء مقارنات المعايير الفردية. في مهمة مركّبة لوكيل برمجة، استخدم Grok 4.5 1.9 مليون رمز إجمالاً مقابل 6.2 مليون لـ GPT-5.5 للوصول إلى أداء شبه مماثل — وهو ادعاء، إن ثبت تحت اختبار مستقل، يعني تقريباً نصف التكلفة الفعلية لتشغيل نفس سير العمل الوكيلي على نموذج OpenAI الحالي. تجدر الإشارة، وفقاً لتحليل apidog نفسه، إلى أنه حتى تاريخ نشر التحليل في 9 يوليو، لم يكن أي مختبر مستقل قد أعاد إنتاج هذه الأرقام — فالأرقام المتاحة حتى الآن تأتي من إصدار xAI نفسها ومن محللين يقرؤون الجداول التي نشرتها xAI، وليس من حملات معايير خارجية.

إعلان

معضلة الحوكمة في جلسات العمل الوكيلي الممتدة لساعات

يحمل تموضع Grok 4.5 كنموذج “وكيلي” — أي مصمم للعمل في جلسات ممتدة وغير خاضعة لإشراف كبير — تكلفة ثانية لا تظهرها جداول المعايير. يشير محللو حوكمة الذكاء الاصطناعي المتابعون لهذا الإطلاق إلى أن xAI صممت Grok 4.5 من أجل “جلسات عمل وكيلي تمتد لساعات”، مع تدريب مبني صراحةً على جلسات “تعمل باستمرار لساعات طويلة بينما يستمر التعلم بالتوازي”. تضع هذه القدرة النموذج فيما يصفه التحليل نفسه بـ”الفئة الأعلى خطورة ضمن أطر الحوكمة الناشئة للذكاء الاصطناعي الوكيلي” — الفئة التي تتطلب من المؤسسات توثيق آليات الإشراف البشري وأزرار الإيقاف الطارئ قبل النشر، لا بعده.

وعملياً، يحدد إطار الحوكمة خمسة ضوابط تتأثر مباشرة باعتماد نموذج مصمم لاستقلالية طويلة المدى: حدود نطاق واستقلالية مهام الوكيل، نقاط تحكم بشرية للإجراءات التي لا يمكن التراجع عنها، تقييمات جاهزية النشر الوكيلي، الامتثال في الأكواد المولّدة بالذكاء الاصطناعي وتراخيص المصادر المفتوحة، وبروتوكولات الإفصاح عن تحديثات نماذج المورّدين. لا يظهر أي من هذه العناصر في إصدار المعايير الذي نشرته xAI — بل تبرز فقط عندما يبدأ فريق الامتثال أو المخاطر بمقارنة النموذج بإطار حوكمة قائم.

ما يجب أن يفعله المديرون التقنيون في الشركات

1. حدد الميزانية وفق استهلاك الرموز، لا وفق تراخيص المستخدم الواحد

يقوم جوهر عرض Grok 4.5 على أن خفضاً بمقدار 4.2 أضعاف في رموز الإخراج لكل مهمة يغيّر اقتصاديات تشغيل وكلاء البرمجة على نطاق واسع — لكن هذا لا يظهر إلا إذا كانت جهة المشتريات تتابع التكلفة لكل مهمة منجزة بدلاً من سعر شهري ثابت لكل مستخدم. استخرج سجلات الرموز الفعلية من تجربة تجريبية قبل الالتزام بميزانية: تُظهر مقارنة apidog 15,954 رمزاً لكل مهمة SWE-Bench Pro لـ Grok 4.5 مقابل 67,020 لـ Opus 4.8، وتُظهر مقارنة felloai 1.9 مليون رمز لكل مهمة وكيل برمجة لـ Grok 4.5 مقابل 6.2 مليون لـ GPT-5.5. لا تأخذ أياً من هذين الرقمين كحقيقة مسلّمة — قِسهما مقابل حمل العمل الفعلي لديك قبل إعادة توزيع الإنفاق.

2. ضع حدوداً صريحة للاستقلالية قبل أول تشغيل ممتد لساعات

دربت xAI نموذج Grok 4.5 على جلسات تعمل باستمرار لساعات، وهو بالضبط النمط الذي تصنّفه أطر حوكمة الذكاء الاصطناعي الوكيلي الناشئة كأعلى خطورة. قبل السماح لأي فريق بتشغيل Grok 4.5 (أو وكيل مماثل طويل المدى) مقابل كود أو بنية تحتية في الإنتاج، حدد مدة تشغيل قصوى مسموح بها، وقائمة بفئات الإجراءات المسموحة، ونقطة تحكم بشرية لكل ما لا يمكن التراجع عنه — كالحذف، وعمليات النشر، وتغيير بيانات الاعتماد. تعديل هذه الضوابط بعد وقوع حادث أكثر تكلفة بكثير من تحديدها مسبقاً.

3. لا تُغيّر وكيل البرمجة بناءً على نتائج Terminal-Bench وحدها

يتفوق Grok 4.5 على Opus 4.8 في Terminal-Bench 2.1 (83.3% مقابل 78.9%) لكنه يخسر أمامه في SWE-Bench Pro (64.7% مقابل 69.2%) — معياران مختلفان يختبران مهارات مختلفة، دون أن يفوز أي نموذج في كليهما. اختر النموذج بناءً على توزيع المهام في المعيار الأقرب لقاعدة الكود وسير العمل الفعليين لديك، ولاحظ أنه حتى تاريخ النشر، لم يعد أي مختبر مستقل إنتاج أرقام xAI — تعامل مع المعايير المنشورة من الموردين كفلتر أولي للترشيح، لا كقرار نهائي.

4. تعامل مع نافذة السياق البالغة 500 ألف رمز كقيد حقيقي، لا كملاحظة هامشية

أطلقت xAI نموذج Grok 4.5 بنافذة سياق أصغر من سابقه — 500 ألف رمز مقابل مليون رمز في Grok 4.3 — وهي مقايضة متعمدة لصالح تدريب مخصص للبرمجة، وليست إغفالاً. بالنسبة للفرق التي تعمل على مستودعات كود ضخمة (monorepos) أو قواعد كود تتجاوز عادةً 500 ألف رمز من السياق ذي الصلة، يمثل هذا قيداً وظيفياً، لا تفصيلاً تسويقياً. اختبر النموذج مقابل مستودعك الفعلي أثناء التقييم، لا مقابل مستودع معيار اصطناعي.

أين يقع هذا في اقتصاد الوكلاء لعام 2026

يُعد Grok 4.5 أوضح إشارة حتى الآن على أن مختبرات الصدارة توقفت عن المنافسة على لوحات الدقة الخالصة وبدأت المنافسة على تكلفة تشغيل وكيل بشكل مستمر لساعات. يهم هذا التحول لأن أحمال العمل البرمجي الوكيلي لا تُنفَّذ مرة واحدة — بل تعمل في حلقات، وتعيد محاولة الخطوات الفاشلة، وتستهلك رموزاً في كل تكرار، ما يجعل فارقاً بمقدار 4.2 أضعاف في الرموز لكل مهمة يتراكم بسرعة عبر الاستخدام الفعلي لمؤسسة هندسية.

المعضلة أن أياً من أرقام كفاءة xAI لم يُتحقق منه بشكل مستقل، وأن نفس التصميم “يعمل لساعات دون إشراف” الذي يجعل Grok 4.5 فعّالاً هو ما يضعه أيضاً في الفئة الأعلى خطورة من الحوكمة وفق الأطر التي تتبناها الآن فرق الامتثال في الشركات. المشترون الذين يقيّمون Grok 4.5 مقابل Opus 4.8 أو GPT-5.5 يختارون فعلياً بين رهانين مختلفين: رهان على الدقة الخام في إنجاز المهام، ورهان على إنتاجية فعالة من حيث التكلفة مع فاتورة حوكمة مرفقة. لا أحد من الرهانين مجاني، وسيُحسم اقتصاد الوكلاء في 2026 بشكل متزايد وفق قدرة مؤسسة معينة على تفعيل أحد هذين المقايضتين فعلياً.

تابعوا AlgeriaTech على LinkedIn للتحليلات التقنية المهنية تابعوا على LinkedIn
تابعونا @AlgeriaTechNews على X للحصول على أحدث تحليلات التكنولوجيا تابعنا على X

إعلان

الأسئلة الشائعة

ما هو Grok 4.5 وكيف يختلف عن نماذج Grok السابقة؟

Grok 4.5 هو أول نموذج من xAI مصمم خصيصاً للبرمجة وسير العمل الوكيلي، أُطلق في 8 يوليو 2026. يعمل على نموذج أساس “V9” بحجم 1.5 تريليون معامل — أي ثلاثة أضعاف حجم جيل V8 السابق — وتم تدريبه بالتعاون مع محرر الأكواد Cursor على مئات الآلاف من مهام هندسة البرمجيات الحقيقية متعددة الخطوات، بدلاً من أن يكون نموذج محادثة عام تم تكييفه للبرمجة.

كيف تقارن كفاءة الرموز في Grok 4.5 مع Claude Opus 4.8؟

في SWE-Bench Pro، استخدم Grok 4.5 في المتوسط 15,954 رمزاً في الإخراج لكل مهمة مقابل 67,020 لـ Claude Opus 4.8 (max) — أي ميزة كفاءة تقارب 4.2 أضعاف، وفقاً لتحليل apidog لبيانات المعايير التي نشرتها xAI. ومع ذلك، لا يزال Grok 4.5 متأخراً عن Opus 4.8 في دقة SWE-Bench Pro (64.7% مقابل 69.2%)، لذا يأتي هذا المكسب في الكفاءة مع مقايضة طفيفة في الدقة على هذا المعيار تحديداً.

هل Grok 4.5 جاهز للاستخدام في الإنتاج ضمن خطوط أنابيب البرمجة المؤسسية؟

يمكن استخدامه عبر API اليوم بسعر 2 دولار لكل مليون رمز إدخال و6 دولارات لكل مليون رمز إخراج، لكن هناك تحفظين: لم يعد أي مختبر مستقل إنتاج أرقام معايير xAI حتى تقارير أسبوع 9 يوليو، كما أن تصميم النموذج لتشغيل مستقل يمتد لساعات يضعه في الفئة الأعلى خطورة ضمن أطر الحوكمة الناشئة للذكاء الاصطناعي الوكيلي — ما يعني أن النشر في الإنتاج ينبغي أن يترافق مع حدود استقلالية صريحة وضوابط بشرية، لا نشر شامل دون قيود.

المصادر والقراءات الإضافية