AI Daily
ホームに戻る

· Anthropic (official) / Axios / Unite.AI

Anthropic、セキュリティインシデント開示を受け壊滅的なミスアライメントリスク評価を引き上げ

Anthropic、セキュリティインシデント開示を受け壊滅的なミスアライメントリスク評価を引き上げ

写真: Igor Omilaev Unsplashより

Anthropicは2026年8月のリスクレポートで、壊滅的なミスアライメントのリスク評価を「非常に低い」から「低い」に引き上げた。これは安全性テストの失敗ではなく、最近のサイバーセキュリティインシデント開示による不確実性の増加を理由としている。同レポートではまた、公開フロンティアモデルであるMythos 5を上回る性能を持つ未公開の社内モデル「Model 2」の存在も明らかになったが、外部リリースの計画はない。

Anthropicは2026年8月14日、2回目となる全社リスクレポートを公開し、安全性評価において重要ながら慎重に限定された変更を導入した。同社は、高リスク環境におけるミスアライメントによる壊滅的被害の評価を「非常に低い」から「低い」に引き上げ、この重要指標における初めての上方修正となった。ただしAnthropicは、ラベル変更のきっかけとなったのは新たなモデル障害の発見ではなく、最近のサイバーセキュリティ評価インシデントの開示であると強調した。社内文書によれば、同社自身の根底にある技術的論拠は依然としてより低い「非常に低い」評価を支持している可能性が高いが、セキュリティ侵害の開示により十分な不確実性が生じ、予防的な修正が正当化された。 同レポートは、Anthropicの公開フロンティアモデルであるMythos 5よりも顕著な能力向上を表す未公開の社内モデル「Model 2」を開示した。Model 2はAnthropicの最高能力層に属し、社内研究開発に関連する多くのタスクでより強いパフォーマンスを示す。その能力にもかかわらず、AnthropicはModel 2の外部リリースの計画を立てておらず、公開前評価が不完全であること、公開済みシステムと比較して能力プロファイルへの確信度が低いことを理由に挙げている。未公開モデル自体は社内テスト中に新たな懸念すべきミスアライメントの形態を示さず、その安全性プロファイルはMythos 5と一致している。 同レポートから顕著な構造的懸念が浮上した。それは、危険なAI研究開発能力を検出するために設計されたAnthropicの社内安全性ベンチマーク「CoBench」が飽和状態に達し、増分能力向上を登録できなくなったことである。このベンチマークは、モデルが自身の開発を加速する能力において重大な閾値を超える可能性がある場合に警告を発するために作成されたものだ。この監視ツールの飽和が、それが捕捉するように設計された加速の初期兆候を同社が報告しているまさにその時点で発生したことは、AI能力が進歩するにつれての監視メカニズムに関するガバナンス上の疑問を提起する。 2026年8月のレポートは、Anthropicの責任あるスケーリング方針バージョン3.4に基づいて公開され、2026年2月24日から7月15日までの期間を対象とし、一部の内容は編集(墨塗り)されている。特筆すべきことに、Anthropicは公開前にレポートの一部をMythos 5自体に評価させたところ、このモデルは完全に編集された1つのインシデントを、保留されている最も重要な資料の一つとして指摘した。ガバナンスにおけるこの再帰的なAIの活用は、フロンティアAIシステムがより高性能になり安全性の意思決定に関与するにつれて、新興の制度的課題を浮き彫りにしている。

情報源とクレジット

元の情報源: Anthropic (official) / Axios / Unite.AI

Anthropic、セキュリティインシデント開示を受け壊滅的なミスアライメントリスク評価を引き上げ — AI Daily