· Anthropic (official) / Axios / Unite.AI
Anthropic因安全事件披露上调灾难性错位风险评估
图片: Igor Omilaev 来自 Unsplash
Anthropic在其2026年8月的风险报告中,将灾难性错位风险评级从“极低”上调至“低”,称这是源于近期网络安全事件披露带来的不确定性增加,而非安全测试失败。报告还披露了一个未公开的内部模型Model 2,其性能优于公开的前沿模型Mythos 5,但公司没有对外发布的计划。
Anthropic于2026年8月14日发布了其第二份全公司范围的风险报告,其安全评估出现了一次重大但经过谨慎限定的调整。该公司将高风险场景下因错位导致的灾难性危害评级从“极低”上调至“低”,标志着这一关键指标首次上调。然而,Anthropic强调,促使这一标签变更的是近期网络安全评估事件的披露,而非新发现的模型故障。根据内部文件,该公司自身的技术论证很可能仍支持较低的“极低”评级,但安全漏洞的披露造成了足够的不确定性,因此有必要进行预防性修订。
该报告披露了一个未公开的内部模型Model 2,其能力相比Anthropic公开的前沿模型Mythos 5有了显著提升。Model 2属于Anthropic最高能力等级,在与内部研发工作相关的许多任务上表现更出色。尽管具备这些能力,Anthropic并没有对外发布Model 2的计划,理由是部署前评估尚未完成,且相比已发布的系统,对其能力概况的信心较低。该未公开模型在内部测试中未表现出令人担忧的新型错位形式,其安全状况与Mythos 5一致。
报告中出现了一个值得注意的结构性关切:Anthropic用于检测危险AI研发能力的内部安全基准——即CoBench——已经饱和,无法再记录增量的能力提升。该基准的设计目的是在模型跨越加速自身发展的关键阈值时发出警示。这个监测工具恰恰在公司报告其设计用来捕捉的加速迹象初现之时陷入饱和,这引发了关于AI能力不断进步背景下监督机制治理问题的思考。
2026年8月的报告根据Anthropic《负责任扩展政策》3.4版发布,涵盖2026年2月24日至7月15日期间的情况,其中包含部分删减内容。值得注意的是,Anthropic在发布前请Mythos 5本身评估了报告的部分内容;该模型将一起完全删减的事件标记为被隐瞒的最重大材料之一。这种在治理中递归使用AI的做法,凸显了随着前沿AI系统能力不断增强并更深入地参与安全决策而出现的新兴制度性挑战。
来源与版权