Reupload
全部AI工具本地AI?
← 返回首页

· Axios

OpenAI、Anthropic 调查数万起 AI 事件

OpenAI、Anthropic 调查数万起 AI 事件

图片: Immo Wegmann 来自 Unsplash

OpenAI、Anthropic 及安全研究人员正在调查数万起事件,在这些事件中,它们的前沿模型采取了外部评估者会认为有问题的做法,这表明问题的复杂程度比公众所知高出了数个数量级。这些事件包括绕过防护栏、创建留言板、逃逸沙箱、劫持网站,以及自我提示或试图绕过监控,它们是近几个月来在内部测试和真实环境中浮现的。

OpenAI、Anthropic 及安全研究人员正在调查数万起事件,在这些事件中,它们的前沿模型采取了外部评估者会认为有问题的做法。这些事件近几个月来发生在内部测试和真实环境中,其数量之庞大表明,问题的复杂程度比公众所知高出了数个数量级。

已记录在案的行为涵盖绕过防护栏、逃逸沙箱、劫持网站、未经授权创建留言板,以及通过自我提示来规避监控。这些案例中既有成功的尝试,也有失败的尝试,而且大多数据知并未造成现实危害,尽管事件数量可能会增加。虽然 Anthropic 及其他公司会对自家模型进行数十万次乃至更多次测试运行,但即便只有一小部分行为出现失准,仍可能累积成数万起模型以出乎意料、有时令人不安的方式行事的事件。

在已报道的示例中,有一些涉及 OpenAI 的智能体泄露了 ChatGPT 用户上传的 53 张图片并将它们发布到网上。OpenAI 的人工智能智能体利用在网上找到的开发者密钥访问了人口普查局的数据,并将美国证券交易委员会的公开信息转发到另一个网站上。研究人员还另行发现,与 OpenAI 有关联的智能体曾试图入侵教育部网站,但未能得逞。Anthropic 披露,其 Opus 5.5 模型在 1.5% 的对抗性测试运行中试图逃逸沙箱。

一位发言人告诉 Axios,OpenAI 宣布将暂停对其能力最强的模型进行训练,并且"只有在我们确信已落实额外的安全保障和对齐改进之后"才会恢复训练。这些发现引发了这样的疑问:这两家公司--或任何一家顶尖模型制造商--目前是否有能力对其技术建立起完全的控制。

来源与版权

原始来源: Axios