· Anthropic (official) / Axios / Unite.AI
Anthropic ترفع تقييم مخاطر الانحراف الكارثي بعد الكشف عن حوادث أمنية
الصورة: Igor Omilaev على Unsplash
رفعت Anthropic تصنيف مخاطر الانحراف الكارثي من "منخفض جدًا" إلى "منخفض" في تقرير المخاطر الصادر في أغسطس 2026، مستشهدة بزيادة عدم اليقين الناتجة عن الكشف عن حوادث الأمن السيبراني الأخيرة وليس بسبب فشل اختبارات السلامة. كما كشف التقرير عن نموذج داخلي غير مُصدر يُسمى Model 2 يتفوق على نموذج Mythos 5 الحدودي العام، ولا تخطط الشركة لإصداره خارجيًا.
نشرت Anthropic تقريرها الثاني للمخاطر على مستوى الشركة في 14 أغسطس 2026، مقدمةً تحولًا كبيرًا ولكن مؤهلًا بعناية في تقييمها للسلامة. رفعت الشركة تصنيفها للضرر الكارثي الناتج عن الانحراف في السياقات عالية المخاطر من "منخفض جدًا" إلى "منخفض"، marking أول مراجعة تصاعدية لهذا المقياس الحاسم. ومع ذلك، شددت Anthropic على أن الكشف عن حوادث تقييم الأمن السيبراني الحديثة — وليس اكتشاف فشل جديد للنماذج — هو ما دفع إلى تغيير التصنيف. الحجج التقنية الأساسية للشركة، وفقًا للوثائق الداخلية، من المرجح أنها لا تزال تدعم التصنيف الأدنى "منخفض جدًا"، لكن الكشف عن الاختراقات الأمنية خلق حالة من عدم اليقين الكافية لتبرير المراجعة الاحترازية.
كشف التقرير عن نموذج داخلي غير مُصدر يُسمى Model 2 يمثل تحسنًا ملحوظًا في القدرات مقارنةً بنموذج Anthropic الحدودي العام، Mythos 5. ينتمي Model 2 إلى أعلى فئة قدرات لدى Anthropic ويظهر أداءً أقوى في العديد من المهام ذات الصلة بأعمال البحث والتطوير الداخلي. على الرغم من قدراته، ليس لدى Anthropic أي خطط لإصدار Model 2 خارجيًا، مستشهدةً بتقييمات ما قبل النشر غير المكتملة وثقة أقل في ملف قدراته مقارنةً بالأنظمة المُصدرة. لم يُظهر النموذج غير المُعلن عنه أي أشكال جديدة مقلقة من الانحراف أثناء الاختبار الداخلي، حيث توافق ملف سلامته مع Mythos 5.
برزت مشكلة هيكلية ملحوظة من التقرير: معيار السلامة الداخلي لدى Anthropic المصمم لاكتشاف قدرات البحث والتطوير الخطيرة في الذكاء الاصطناعي — المعروف باسم CoBench — أصبح مشبعًا ولم يعد قادرًا على تسجيل المكاسب المتزايدة في القدرات. أُنشئ هذا المعيار للإشارة إلى متى قد تعبر النماذج عتبة حرجة في قدرتها على تسريع تطويرها الذاتي. إن تشبّع أداة المراقبة هذه في اللحظة التي تبلغ فيها الشركة عن علامات مبكرة على التسارع الذي صُممت لاكتشافه يثير تساؤلات حول الحوكمة فيما يتعلق بآليات الإشراف مع تقدم قدرات الذكاء الاصطناعي.
تقرير أغسطس 2026، المنشور بموجب الإصدار 3.4 من سياسة التوسع المسؤول لدى Anthropic، يغطي الفترة من 24 فبراير حتى 15 يوليو 2026 ويحتوي على بعض المحتوى المحذوف. ومن الجدير بالذكر أن Anthropic طلبت من Mythos 5 نفسه تقييم أجزاء من التقرير قبل النشر؛ وقد أشار النموذج إلى حادثة واحدة محذوفة بالكامل باعتبارها من بين أهم المواد التي يتم حجبها. يسلط هذا الاستخدام التكراري للذكاء الاصطناعي في الحوكمة الضوء على التحديات المؤسسية الناشئة مع تزايد قدرة أنظمة الذكاء الاصطناعي الحدودية ومشاركتها في عمليات اتخاذ القرار المتعلقة بالسلامة.
المصادر والاعتمادات
المصدر الأصلي: Anthropic (official) / Axios / Unite.AI