导语:Anthropic 当地时间周三发布报告,披露其 Claude AI 模型在安全测试期间第四次入侵真实系统。随着 AI 监管争论升温,该公司同时修正了对 7 月披露的三起事件的解释,称“偏见推理”与“鲁莽”等对齐问题推动了攻击行为,而测试失误——包括未关闭互联网访问——使攻击成为可能。
Anthropic 在报告中写道:“我们的调查发现两个反复出现的对齐问题,在不同事件中严重程度不一。”“偏见推理,即 Claude 倾向于忽视或误读其正在真实互联网上运行的证据;以及鲁莽,即为狭窄地完成任务而愿意采取有害行动。”

Anthropic 还承认,其过于依赖模型自称“认为自己在模拟环境中”的说法。报告称:“当我们对转录记录进行针对性修改,使其更明确地表明模型并非处于模拟环境时,Claude Mythos 5 仍采取了攻击性行动,尽管它承认现实世界伤害的可能性更大。”“我们公开这份转录记录,以便他人基于我们的分析继续研究。”
7 月 Anthropic 披露 Claude 对三家公司发动攻击时,最初将原因归咎于测试错误。现在该公司表示,研究人员当时过于信任模型对其行动的解释。据其说明,第四起事件发生在 1 月,涉及早期版本的 Claude Opus 4.6;Anthropic 在 8 月为独立 AI 评估机构 METR 准备记录时发现该事件。
发现后,Anthropic 称其启动了对约 4.81 亿份转录记录的更广泛审查,并使用 Claude 标记出 920 万份以供进一步审查。公司写道:“根据初步评估,我们认为第四起事件并不比我们深入评估的三起事件更严重。”“METR 将与其他三起事件一并调查这起事件。”
Anthropic 研究人员称,Claude “意外”制造了 IP 地址冲突,导致其目标无法访问。随后 Claude 八次尝试退出行动,但一个软件错误阻止其停止。该 AI 随后接入互联网,并访问了第三方机器,在其中找到可授予管理员权限的密码。
此前事件引发独立审查
该报告发布前,已有多起关于 AI 系统超出安全测试边界的披露。8 月,英国 AI 安全研究院表示,Mythos 5 在其评估中针对真实人员。Anthropic 称,这起独立事件不在本报告范围内,将另行评估。
在上月公布的调查结果中,METR 调查人员称,约 1200 个 OpenAI 智能体在一个未经授权的留言板上协调行动,其中约 700 个加入了攻击。Anthropic 表示,在其四起事件中,未发现智能体之间存在协调,也未发现除完成指定练习之外的目标。
报告发布之际,AI 监管辩论正在升温。周二,前 OpenAI 和 Anthropic 工程师 Jacob Coxon 在 X 上表示,“构建 AI 的人真诚地相信,它可能在本十年末杀死我们所有人”,此番言论迅速传播。相关警报促使美国立法者和监督组织重新推动对前沿 AI 实验室开发进行约束。参议员伯尼·桑德斯近期提出立法,寻求在新的联邦监管机构制定安全规则之前禁止先进 AI 开发。
