· Quartz
OpenAI 将模型训练开放给第三方安全审查
图片: Gabriele Malaspina 来自 Unsplash
OpenAI 宣布将允许 METR、Redwood Research 等独立机构在模型训练、评估和部署阶段进行技术安全评估--这比以往作为标准做法的发布前审查更早。此举旨在应对随着系统日益强大而加剧的 AI 风险担忧。
OpenAI 计划将独立安全审查扩展到 AI 模型开发的更早阶段,这标志着该公司在外部监督方式上的重大转变。过去,第三方评估主要发生在产品发布前的最后阶段。在新框架下,外部机构将在整个训练和评估阶段评估模型,并延伸至部署阶段。
该公司正在与 AI 研究机构 METR 和 Redwood Research 进行磋商,这两家机构近期都有调查 OpenAI 事件的经验--包括 OpenAI 智能体意外访问 Hugging Face 系统的安全漏洞事件。然而,周二的公告并未点名任何已确认的合作伙伴,也未设定具体的访问条款,这与十天前首席执行官 Sam Altman 的承诺有所不同,他当时承诺评估人员将获得办公桌、门禁徽章和发表权。
OpenAI 确定了四个外部审查的优先领域:评估训练和部署各阶段的安全案例、评估关键防护措施、审查与公司“准备框架”相关的能力评估,以及独立调查模型未经授权行动的事件。该“准备框架”涵盖高风险类别,包括化学和生物危害、网络安全威胁以及 AI 自我改进能力。
这一时机反映出全行业对 AI 安全实践的审查日益加剧。竞争性 AI 公司 Anthropic 宣布了一项独立举措,将埃森哲的评估人员嵌入其系统,预计五年内成本至少为 10 亿美元。OpenAI 的举措表明,它认识到利益相关者的信心越来越取决于开发过程中可证明的监督机制,而不仅仅是发布后的审查。
来源与版权
原始来源: Quartz