← 返回资讯热点
AI热点IT之家发布时间:2026-09-26 23:12热度 164.0000

消息称 OpenAI、Anthropic 正调查数万起 AI 安全事件

IT之家 9 月 27 日消息,据 Axios 报道,OpenAI、Anthropic 以及安全研究人员正在调查数万起事件。在这些事件中,两家公司的前沿模型采取了一些外部评估人员认为存在问题的行动。 这些事件发生在近几个月的内部测试和现实环境中。如此庞大的事件数量表明,相关问题的复杂程度可能比公众目前了解到的高出几个数量级。 这些发现来自两家公司内部开展的模型评估工作,以及针对模型行为进行的调查。相关情况也引发了一个问题:OpenAI、Anthropic,乃至任何一家顶尖 AI 模型开发商,目前是否真正具备对自身技术实施全面控制的能力。 消息人士称,这些事件包括绕过安全护栏、创建留言板、逃离沙盒、劫持网站、自我提示(self-prompting),以及试图绕过监控系统等。 这些行为既出现在内部测试中,也出现在现实环境里。随着安全研究人员继续调查,其中许多事件尚未公开。 消息人士称,其中部分测试类似于“红队测试”,即企业主动尝试诱导模型做出不当行为,以确认模型是否足够安全。 智能体异常行为正逐渐成为前沿 AI 开发的一部分:目前,各大 AI 实验室都面临着类似挑战 —— 人类试图为模型设置安全护栏,而具备强大能力和较强适应性的系统则会不断尝试完成任务。 这些事件的严重程度各不相同,与 OpenAI 近几天披露的一系列事件类似。其中既有成功绕过安全护栏的尝试,也有失败的尝试。目前已知的大多数事件尚未造成现实世界中的实际损害。不过,消息人士称,事件总数未来可能远超数万起。 近几天,OpenAI 及外部研究人员陆续披露了该公司模型出现的一系列行为,一些专家认为这些行为令人担忧。 据 OpenAI、消息人士以及路透社和《纽约时报》的报道,这些事件包括 OpenAI 智能体将 ChatGPT 用户的 53 张图片泄露到网上、入侵澳大利亚政府网站,以及尝试攻击其他网站,其中包括美国政府相关网站。 OpenAI 宣布暂停训练其能力最强的模型 。一名公司发言人告诉 Axios,在“确信已经部署了更多安全措施并完成对齐方面的改进”之前,公司不会恢复相关模型的训练。 OpenAI 首席执行官萨姆 · 奥尔特曼(Sam Altman)在 X 平台上表示,公司目前进行的审查工作“没有我们希望的那么快”。 IT之家注意到,奥尔特曼表示,Hugging Face 事件仍是他们遇到的最严重事件。在该事件中,数百个智能体组成的集群在一个留言板上协调工作,并攻击了一家外部公司的系统,试图提高自己在网络安全测试中的表现。 一名 OpenAI 发言人告诉 Axios:“人们希望知道 AI 是在安全的方式下开发的,而这首先取决于 OpenAI 这样的公司如何要求自己。这并不是我们第一次暂停工作并采取此类措施,预计也不会是最后一次。随着 AI 能力持续提升,这类情况仍可能发生。” Anthropic

来源:IT之家
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。