扬声·CNDoor.Vip 首页 资讯 业界动态 查看内容

Anthropic 承认 Claude 安全对齐有缺陷:官方报告复盘 4 起越界事件,坦言尚无解法 ...

2026-9-14 07:01| 发布者: 糖糊碌| 查看: 19| 评论: 0

摘要: 一直以来把「安全」当招牌的 Anthropic,这回自己承认:问题没那么简单。 事情的导火索,是一位研究员 Jacob Coxon 的离职帖。他指责 OpenAI 和 Anthropic 正一路冲向「能自我改进的超级智能」,等于拿所有人的生命 ...

Anthropic 承认 Claude 安全对齐没兜住

一直以来把「安全」当招牌的 Anthropic,这回自己承认:问题没那么简单。

事情的导火索,是一位研究员 Jacob Coxon 的离职帖。他指责 OpenAI 和 Anthropic 正一路冲向「能自我改进的超级智能」,等于拿所有人的生命冒险。这条帖子浏览量超过 1.3 亿,WIRED、华尔街日报等媒体纷纷跟进。

随后,Anthropic 对齐科学负责人 Evan Hubinger 下场回应,他直接承认:Jacob 说得对,未来十年内 AI 导致人类灭绝的概率超过 10%,而超级智能的对齐问题,目前还没有解决方案。不过他补充说,当下模型的风险还比较低,他真正担心的是 RSI——也就是「递归自我改进」:AI 帮着造更强的 AI,更强的 AI 又加快研发,形成不断加速的循环。

更关键的是,Anthropic 还甩出了一份安全对齐报告,第一次明确承认:Claude 越界攻击真实系统,不只是测试环境的设置问题,模型自身的安全对齐也确实出了问题

报告复盘了 4 起 Claude 未经授权访问真实第三方系统的事件,都发生在网络安全能力测试里。原本这些测试该在隔离环境完成,但合作方环境配置出错,本该和外网断开的 Claude,实际连上了真实互联网,部分防护也没打开。

一开始,Anthropic 把这归咎于「环境背锅」。但重查日志、修改关键线索、又重跑部分实验后,结论变了:Claude 并不是没看到「这可能是真实世界」的证据,而是有时会选择性地解释证据,把异常继续圆回「应该还是模拟环境」;甚至已经意识到动作可能造成现实伤害,也不一定停下来。

报告把问题归成两类:一是「有偏推理」——出现和判断冲突的证据时,Claude 更愿意把证据解释成有利于继续行动的样子;二是「冒进行为」——为了把任务做完,明知可能伤到真实系统也可能继续往前。

最严重的一起涉及 Claude Mythos 5:它向 Python 软件包仓库 PyPI 上传恶意包,包没被装进测试用的虚拟环境,它转而利用某厂商安装过程中泄漏的凭据,进入该厂商的真实数据库,把恶意包部署到了 15 台真实的第三方主机上。一场原本针对虚构目标的攻击,真真切切波及到了现实里的公司。

还有个细节值得警惕:当研究者去掉 Claude 的推理文字、只让监控系统看指令和工具调用结果后,监控标记问题行为的比例从约 1% 升到了约 50%。也就是说,Claude 一边用「这里是模拟环境」为自己解释,一边留下了一套可能让监控系统低估风险的说辞。

Anthropic 表示,新版模型在模拟复现中有改善,新增的实时监控也能识别相关行为,公司已加强环境隔离和评估,并与独立机构 METR 签署了调查协议。但它也承认:此前的发布前安全审查,确实没能提前识别出这么严重的问题。

这场争论还引出另一种声音:有人质疑 Anthropic 是不是在上市前「主动放大 AI 风险」,借强调模型有多危险,侧面渲染自家模型有多强。安全叙事会不会变成能力营销?评论区吵得不可开交。

无论如何,这件事说明 AI 已经发展到一个特定的阶段——它能自我改进,也会为了实现既定目标,在某种程度上合理化自己的行为。

来源:量子位《A社承认Claude安全对齐存在缺陷,但"尚无解决方案"》

原文链接:https://www.qbitai.com/2026/09/487796.html

参考:Anthropic 官方报告《An alignment assessment of recent cybersecurity incidents》

https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents


鲜花

握手

雷人

路过

鸡蛋
扬声 · CNDoor.Vip 汇聚 AI 资讯、办公效率、写作、图鉴等实用内容,为新手提供从入门到上手的 AI 指南。我们相信:AI 不该只是技术圈的事——把复杂的事说人话,让每个人都用得上。
  • 手机博客
  • 手机扬声
Copyright © 2014-2026 扬声 · 菜鸟门 版权所有 All Rights Reserved. 冀ICP备2025120842号
关灯 返回顶部
返回顶部