· Anthropic (official) / Axios / Unite.AI
सुरक्षा घटना के खुलासे के बाद एंथ्रोपिक ने विनाशकारी मिसअलाइनमेंट जोखिम मूल्यांकन बढ़ाया
फोटो: Igor Omilaev Unsplash पर
एंथ्रोपिक ने अपनी अगस्त 2026 जोखिम रिपोर्ट में अपनी विनाशकारी मिसअलाइनमेंट जोखिम रेटिंग को 'बहुत कम' से बढ़ाकर 'कम' कर दिया, जिसमें विफल सुरक्षा परीक्षणों के बजाय हालिया साइबर सुरक्षा घटना के खुलासे से बढ़ी अनिश्चितता का हवाला दिया गया। रिपोर्ट में मॉडल 2 नामक एक अप्रकाशित आंतरिक मॉडल का भी खुलासा किया गया जो सार्वजनिक Mythos 5 फ्रंटियर मॉडल से बेहतर प्रदर्शन करता है, जिसे कंपनी बाहरी रूप से जारी करने की कोई योजना नहीं बना रही है।
एंथ्रोपिक ने 14 अगस्त, 2026 को अपनी दूसरी कंपनी-व्यापी जोखिम रिपोर्ट प्रकाशित की, जिसमें इसके सुरक्षा मूल्यांकन में एक महत्वपूर्ण लेकिन सावधानीपूर्वक योग्य बदलाव पेश किया गया। कंपनी ने उच्च-दांव वाली सेटिंग्स में मिसअलाइनमेंट से विनाशकारी नुकसान की अपनी रेटिंग को 'बहुत कम' से 'कम' में अपग्रेड किया, जो इस महत्वपूर्ण मीट्रिक का पहला ऊपर की ओर संशोधन है। हालांकि, एंथ्रोपिक ने जोर दिया कि हालिया साइबर सुरक्षा मूल्यांकन घटना के खुलासे—नए मॉडल विफलताओं के निष्कर्ष नहीं—ने लेबल परिवर्तन को प्रेरित किया। आंतरिक दस्तावेज के अनुसार, कंपनी के अपने अंतर्निहित तकनीकी तर्क संभवतः अभी भी निचली 'बहुत कम' रेटिंग का समर्थन करते हैं, लेकिन सुरक्षा उल्लंघनों के खुलासे ने सावधानीपूर्वक संशोधन को उचित ठहराने के लिए पर्याप्त अनिश्चितता पैदा की।
रिपोर्ट में मॉडल 2 नामक एक अप्रकाशित आंतरिक मॉडल का खुलासा किया गया, जो एंथ्रोपिक के सार्वजनिक फ्रंटियर मॉडल, Mythos 5 पर एक उल्लेखनीय क्षमता सुधार का प्रतिनिधित्व करता है। मॉडल 2 एंथ्रोपिक के उच्चतम क्षमता स्तर से संबंधित है और आंतरिक अनुसंधान और विकास कार्य से संबंधित कई कार्यों पर मजबूत प्रदर्शन दिखाता है। अपनी क्षमताओं के बावजूद, एंथ्रोपिक ने मॉडल 2 को बाहरी रूप से जारी करने की कोई योजना नहीं बनाई है, जिसमें अपूर्ण तैनाती-पूर्व मूल्यांकन और जारी किए गए सिस्टम की तुलना में इसकी क्षमता प्रोफ़ाइल में कम विश्वास का हवाला दिया गया है। अप्रकट मॉडल ने आंतरिक परीक्षण के दौरान कोई नया चिंताजनक मिसअलाइनमेंट रूप नहीं दिखाया, जिसकी सुरक्षा प्रोफ़ाइल Mythos 5 के अनुरूप है।
रिपोर्ट से एक उल्लेखनीय संरचनात्मक चिंता उभरी: खतरनाक AI अनुसंधान और विकास क्षमताओं का पता लगाने के लिए डिज़ाइन किया गया एंथ्रोपिक का आंतरिक सुरक्षा बेंचमार्क—जिसे CoBench के रूप में जाना जाता है—संतृप्त हो गया है और अब वृद्धिशील क्षमता लाभ दर्ज नहीं कर सकता। यह बेंचमार्क यह संकेत देने के लिए बनाया गया था कि मॉडल अपने स्वयं के विकास को तेज करने की क्षमता में कब एक महत्वपूर्ण सीमा पार कर सकते हैं। ठीक उसी क्षण इस निगरानी उपकरण का संतृप्त होना जब कंपनी उस त्वरण के शुरुआती संकेतों की रिपोर्ट करती है जिसे पकड़ने के लिए इसे डिज़ाइन किया गया था, AI क्षमताओं के आगे बढ़ने पर निगरानी तंत्रों के बारे में शासन प्रश्न उठाता है।
अगस्त 2026 की रिपोर्ट, एंथ्रोपिक की जिम्मेदार स्केलिंग नीति के संस्करण 3.4 के तहत प्रकाशित, 24 फरवरी से 15 जुलाई, 2026 की अवधि को कवर करती है और इसमें कुछ संपादित सामग्री है। उल्लेखनीय रूप से, एंथ्रोपिक ने प्रकाशन से पहले रिपोर्ट के कुछ हिस्सों का मूल्यांकन करने के लिए Mythos 5 से ही पूछा; मॉडल ने एक पूरी तरह से संपादित घटना को रोके जा रही सबसे महत्वपूर्ण सामग्री के रूप में चिह्नित किया। शासन में AI का यह पुनरावर्ती उपयोग उभरती संस्थागत चुनौतियों को उजागर करता है क्योंकि फ्रंटियर AI सिस्टम अधिक सक्षम और सुरक्षा निर्णय लेने में शामिल होते जा रहे हैं।
स्रोत और क्रेडिट
मूल स्रोत: Anthropic (official) / Axios / Unite.AI