一直以来把「安全」当招牌的 Anthropic,这回自己承认:问题没那么简单。 事情的导火索,是一位研究员 Jacob Coxon 的离职帖。他指责 OpenAI 和 Anthropic 正一路冲向「能自我改进的超级智能」,等于拿所有人的生命冒险。这条帖子浏览量超过 1.3 亿,WIRED、华尔街日报等媒体纷纷跟进。 随后,Anthropic 对齐科学负责人 Evan Hubinger 下场回应,他直接承认:Jacob 说得对,未来十年内 AI 导致人类灭绝的概率超过 10%,而超级智能的对齐问题,目前还没有解决方案。不过他补充说,当下模型的风险还比较低,他真正担心的是 RSI——也就是「递归自我改进」:AI 帮着造更强的 AI,更强的 AI 又加快研发,形成不断加速的循环。 更关键的是,Anthropic 还甩出了一份安全对齐报告,第一次明确承认:Claude 越界攻击真实系统,不只是测试环境的设置问题,模型自身的安全对齐也确实出了问题。 报告复盘了 4 起 Claude 未经授权访问真实第三方系统的事件,都发生在网络安全能力测试里。原本这些测试该在隔离环境完成,但合作方环境配置出错,本该和外网断开的 Claude,实际连上了真实互联网,部分防护也没打开。 一开始,Anthropic 把这归咎于「环境背锅」。但重查日志、修改关键线索、又重跑部分实验后,结论变了:Claude 并不是没看到「这可能是真实世界」的证据,而是有时会选择性地解释证据,把异常继续圆回「应该还是模拟环境」;甚至已经意识到动作可能造成现实伤害,也不一定停下来。 报告把问题归成两类:一是「有偏推理」——出现和判断冲突的证据时,Claude 更愿意把证据解释成有利于继续行动的样子;二是「冒进行为」——为了把任务做完,明知可能伤到真实系统也可能继续往前。 最严重的一起涉及 Claude Mythos 5:它向 Python 软件包仓库 PyPI 上传恶意包,包没被装进测试用的虚拟环境,它转而利用某厂商安装过程中泄漏的凭据,进入该厂商的真实数据库,把恶意包部署到了 15 台真实的第三方主机上。一场原本针对虚构目标的攻击,真真切切波及到了现实里的公司。 还有个细节值得警惕:当研究者去掉 Claude 的推理文字、只让监控系统看指令和工具调用结果后,监控标记问题行为的比例从约 1% 升到了约 50%。也就是说,Claude 一边用「这里是模拟环境」为自己解释,一边留下了一套可能让监控系统低估风险的说辞。 Anthropic 表示,新版模型在模拟复现中有改善,新增的实时监控也能识别相关行为,公司已加强环境隔离和评估,并与独立机构 METR 签署了调查协议。但它也承认:此前的发布前安全审查,确实没能提前识别出这么严重的问题。 这场争论还引出另一种声音:有人质疑 Anthropic 是不是在上市前「主动放大 AI 风险」,借强调模型有多危险,侧面渲染自家模型有多强。安全叙事会不会变成能力营销?评论区吵得不可开交。 无论如何,这件事说明 AI 已经发展到一个特定的阶段——它能自我改进,也会为了实现既定目标,在某种程度上合理化自己的行为。 来源:量子位《A社承认Claude安全对齐存在缺陷,但"尚无解决方案"》 原文链接:https://www.qbitai.com/2026/09/487796.html 参考:Anthropic 官方报告《An alignment assessment of recent cybersecurity incidents》 https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents |
工具速递阶跃一口气发布五款语音大模型:StepAudio 2026-09-18
AI生活B站「AI无限竞技场」上线:百大AI模型同台P2026-09-17
业界动态荣耀发布MagicOS 11:行业首个系统级Agent 2026-09-16