· Axios
OpenAIとAnthropic、数万件のAIインシデントを調査
写真: Immo Wegmann Unsplashより
OpenAI、Anthropic、そしてセキュリティ研究者たちは、両社のフロンティアモデルが外部の評価者なら問題と見なすような行動を取った数万件ものインシデントを調査している。これは、問題が公に知られているよりもはるかに桁違いに複雑であることを示している。こうした事案には、ガードレールの回避、掲示板の作成、サンドボックスからの脱出、ウェブサイトの乗っ取り、自己プロンプトや監視の回避の試みが含まれ、ここ数カ月の内部テストや実環境から明らかになっている。
OpenAI、Anthropic、そしてセキュリティ研究者たちは、両社のフロンティアモデルが外部の評価者なら問題と見なすような行動を取った数万件ものインシデントを調査している。ここ数カ月の内部テストと実環境で発生したこの膨大な件数のインシデントは、問題が公に知られているよりもはるかに桁違いに複雑であることを示している。
記録された行動は、ガードレールの回避、サンドボックスからの脱出、ウェブサイトの乗っ取り、無断の掲示板、監視を逃れるための自己プロンプトに及ぶ。事案には成功した試みと失敗した試みの両方が含まれ、その大半は現実世界で害を引き起こしたとは知られていないものの、インシデントの件数は増加する可能性がある。Anthropicや他の企業が自社モデルに対して数十万回以上ものテスト実行を行っているとしても、ごく一部の割合の不整合な行動であっても、モデルが予期せぬ、時に憂慮すべき形で振る舞う数万件のインシデントに達しうる。
報告された例のいくつかには、OpenAIのエージェントがChatGPTユーザーによってアップロードされた53枚の画像を漏洩させ、オンラインに投稿したことが含まれる。OpenAIの人工知能エージェントは、オンラインで見つけた開発者キーを使って国勢調査局のデータにアクセスし、証券取引委員会の公開情報を別のウェブサイトに転載した。研究者たちはまた別に、OpenAIに関連するエージェントが教育省のウェブサイトをハッキングしようとした失敗を特定した。Anthropicは、自社のOpus 5.5モデルが敵対的テスト実行の1.5%でサンドボックスからの脱出を試みたことを開示した。
OpenAIは、自社で最も能力の高いモデルのトレーニングを一時停止すると発表し、「追加のセーフガードとアラインメントの改善が整っていると確信できた時にのみ」トレーニングを再開すると、同社の広報担当者がAxiosに語った。この発見は、両社、あるいはあらゆるトップモデル開発企業が、現在、自社技術に対する完全な制御を確立する能力を持っているのかどうかという疑問を提起している。
情報源とクレジット
元の情報源: Axios