Claude Opus 5 يقترب من أقوى نماذج أنثروبيك بنصف التكلفة
الذكاء الاصطناعي مكتب نيو تقنية – الذكاء الاصطناعي 5 دقائق للقراءة

Claude Opus 5 يقترب من أقوى نماذج أنثروبيك بنصف التكلفة

تقول أنثروبيك إن Claude Opus 5 يقدم أداء قريباً من نماذجها الأقوى في البرمجة والعمل المكتبي بكلفة أقل بكثير. قد يوسع ذلك استخدام وكلاء الذكاء الاصطناعي داخل الشركات، لكن معظم النتائج المعلنة ما تزال مستندة إلى اختبارات الشركة وشركائها الأوائل.

إعدادات القراءة

كيانات وموضوعات موثّقة

ليست أهم قفزة في نماذج الذكاء الاصطناعي دائماً رقماً أعلى في اختبار معياري. أحياناً تكون القفزة الحقيقية هي أن تصبح القدرة المتقدمة رخيصة بما يكفي لاستخدامها كل يوم. تقول أنثروبيك إن Claude Opus 5 يقترب في مهام كثيرة من نموذجها الأقوى Fable 5، مع كلفة تقارب النصف.

الخلاصة في 30 ثانية

  • ماذا حدث؟ أطلقت أنثروبيك Claude Opus 5 في 24 يوليو، وقدّمته كنموذج يومي قوي للبرمجة والبحث والعمل المكتبي.
  • لماذا يهم؟ قد تجعل كلفته وكفاءته المعلنة تشغيل مهام طويلة بوكلاء الذكاء الاصطناعي خياراً عملياً لمزيد من الشركات والمطورين.
  • ما الذي لم يُثبت؟ تعتمد معظم الأرقام البارزة على اختبارات أنثروبيك وشركائها الأوائل، وما تزال الحاجة قائمة إلى تقييم مستقل واسع.

الرقم الأهم
تبلغ الكلفة 5 دولارات لكل مليون وحدة إدخال و25 دولاراً لكل مليون وحدة إخراج، وهي كلفة Opus 4.8 نفسها وتقارب نصف سعر Fable 5.

لماذا قد يكون السعر أهم من صدارة اختبار جديد؟

يستهلك وكيل الذكاء الاصطناعي كميات كبيرة من النصوص والشفرة البرمجية واستدعاءات الأدوات أثناء تنفيذ مهمة طويلة. لذلك لا تكفي مقارنة سعر وحدة النص وحدها. النموذج الذي يصل إلى النتيجة بمحاولات أقل ونص أقصر وخطوات أقل قد يكون أوفر فعلياً حتى إن لم يتغير سعره المعلن.

تقول أنثروبيك إن Opus 5 حقق أكثر من ضعفي أداء Opus 4.8 في اختبار Frontier-Bench مع خفض كلفة المهمة المكتملة. وتقول أيضاً إنه اقترب بفارق 0.5 نقطة مئوية من Fable 5 في أعلى إعداد للجهد ضمن CursorBench، وبنحو نصف الكلفة لكل مهمة. هذه نتائج لافتة، لكنها تبقى أدلة إطلاق وليست حكماً نهائياً.

أما السؤال العملي لفريق البرمجة فهو أبسط: هل ينجز النموذج مهمة صعبة بثبات كافٍ لتقليل وقت المراجعة والإصلاح البشري؟ إذا كانت الإجابة نعم، تتغير جدوى استخدام الذكاء الاصطناعي في تطوير البرمجيات. القيمة هنا في العمل المكتمل، لا في كمية الشفرة المنتجة.

ما الذي صُمم Opus 5 لإنجازه؟

تصف أنثروبيك نموذجها الجديد بأنه مناسب للأعمال اليومية الطويلة متعددة الخطوات. يتوافر عبر منتجات Claude وواجهة برمجة التطبيقات (Application Programming Interface أو API)، ما يسمح للمطورين بربطه بأدوات البرمجة والوثائق وأنظمة الشركات.

تعلن الشركة تحسناً في إصلاح الأخطاء والوصول إلى أسبابها الأساسية، واستخدام الحاسوب، والبحث المهني وبعض المهام العلمية. ويمكن للمستخدم ضبط مقدار الجهد الحسابي، فيوازن بين السرعة والكلفة وعمق المعالجة. كما يوجد وضع سريع يعمل بسرعة تقارب 2.5 مرة، لكنه يضاعف السعر الأساسي.

تكشف هذه التركيبة تحولاً أوسع في السوق. لم تعد المنافسة مقتصرة على امتلاك النموذج الأذكى، بل تشمل مقدار الذكاء المفيد مقابل كل دولار، وسرعة الاستجابة، والثبات، وقدرة النموذج على متابعة العمل من دون أن يفقد الهدف.

وصول أوسع مع حدود أمان محسوبة

يأتي Opus 5 وسط نقاش حساس حول قدرة النماذج على اكتشاف الثغرات البرمجية واستغلالها. تقول أنثروبيك إن النموذج يقترب من نظام Mythos 5 الأقوى في العثور على الثغرات، لكنه أضعف بوضوح في تحويلها إلى أدوات اختراق قابلة للاستخدام.

لذلك تسمح ضوابطه ببعض عمليات فحص الشفرة لأغراض دفاعية، وتمنع عن المستخدم العادي أنشطة أعلى خطراً، مثل اختبار الاختراق، وفحص الملفات التنفيذية بحثاً عن الثغرات، وإنشاء أدوات الاستغلال. ويمكن لبعض الباحثين الموثقين الحصول على وصول أقل تقييداً عبر برنامج منفصل.

وتقول أنثروبيك أيضاً إن تدقيقاً سلوكياً آلياً منح Opus 5 أقل معدل للسلوك غير المتوافق بين نماذجها الحديثة. هذه معلومة مفيدة، لكنها صادرة عن الجهة التي طورت النموذج. وقد تكشف الاستخدامات الواقعية مشكلات لا تظهر في الاختبارات المضبوطة.

ما الذي ينبغي للشركات اختباره قبل الانتقال؟

تصدّر اختبار معياري لا يجعل النموذج مناسباً تلقائياً لكل مؤسسة. ينبغي اختبار Opus 5 على الشفرة والوثائق ومسارات الموافقة الحقيقية، مع قياس كلفة المهمة المكتملة، ونسبة الأخطاء، ووقت المراجعة، وأثر القرار الخاطئ.

في الأعمال الحساسة، تبقى صلاحيات الوصول والموافقة البشرية ضرورية. فالنموذج القادر على تشغيل البرامج أو تعديل نظام إنتاجي قد يسبب ضرراً أكبر بكثير من مساعد يكتب مسودة نص. كما يجب مراجعة شروط الاحتفاظ بالبيانات، والتوافر الجغرافي، وما إذا كان التحويل التلقائي يرسل الطلب المرفوض إلى نموذج آخر يتصرف بصورة مختلفة.

قبل أن نبالغ في النتيجة

  • معظم نتائج الأداء والأمان البارزة أعلنتها أنثروبيك عند الإطلاق.
  • آراء العملاء الأوائل مفيدة، لكنها لا تعوّض تقييماً مستقلاً يمكن تكراره.
  • التفوق في اختبارات البرمجة لا يثبت الثبات داخل أنظمة الشركات الخاصة أو في الحالات النادرة.
  • السعر الأقل لوحدات النص لا يضمن فاتورة أقل إذا أرسل التطبيق سياقات ضخمة أو شغّل الوكلاء بلا حدود واضحة.

ما الخطوة التالية؟

سيأتي الدليل الأهم من الاختبارات المستقلة والاستخدام الفعلي خلال الأسابيع المقبلة. يريد المطورون معرفة ما إذا كان Opus 5 يحافظ على مستواه مع أدوات برمجة ولغات ومهام طويلة مختلفة، وما إذا كانت كلفته المنخفضة تبقى كذلك بعد احتساب جميع خطوات سير العمل.

إذا صمدت الادعاءات، فقد لا تكمن أهمية Opus 5 في تسجيل رقم مذهل جديد، بل في كونه محطة اقتصادية. قدرة كانت محصورة في المستوى الأعلى تنتقل إلى فئة الاستخدام اليومي، وقد يسرّع ذلك انتشار وكلاء الذكاء الاصطناعي في البرمجة والبحث والعمل المكتبي.

المصادر والمراجع4 مصادر

نشر بواسطة

N

مكتب نيو تقنية – الذكاء الاصطناعي

فريق تحريري مؤسسي تابع لنيو تقنية

يتوفر إصدار جديد من نيو تقنية.