Claude 开始训练 Claude!时薪 4 美元的 AI 研究员,干赢了时薪 150 美元的人类AI「自己改进自己」的那一天,好像越来越近了。据了解,AI 圈明星公司 Anthropic(Claude 背后的团队)最近发布了一项重磅研究:他们把自身最先进的 Claude 模型「送进实验室」,让它像研究员一样独立做 AI 安全研究——自己查论文、提方案、造数据、训练模型,一口气攻克了 10 类 AI 常见的安全问题。 这套系统叫 AAR(自动化对齐研究员),基于 Claude Opus 4.8 搭建。拿到一个模型安全问题后,Claude 会自己搜索相关论文、从中找方法,再提出训练方案、生成数据、微调模型,最后跑一遍安全和通用能力测试。一轮训练通常只跑 30 分钟,效果不好就换方案,成绩有提升就沿着这个方向继续试,像搜索算法一样快速试错。整个过程里,人类负责出题、给模型、定评测标准,剩下的脏活累活基本都交给 Claude。 结果相当亮眼。 10 类常见安全问题——包括欺骗、谄媚、奖励黑客、隐私侵犯、越狱等——Claude 全部给出了改进方案,按 Anthropic 定义的「安全差距」指标,弥合了 26% 到 96% 的差距,而且没有损害模型原有的通用能力。 最戏剧性的一幕是人机对比。在「欺骗」这道题上,Claude 平均弥合了 85% 的安全差距;而同一道题,Anthropic 交给 6 名经验丰富的 AI 安全研究员,平均只弥合了 20%。更扎心的是成本:一个 AAR 每小时的 API 推理成本大约 4 美元,而 Anthropic 付给人类研究员的报酬是每小时 150 美元。 研究里还有一个更"进化"的玩法:让能力较弱的 Claude Sonnet 5 去训练还没完成生产级安全训练的 Claude Opus 4.8 早期版本。60 小时里 Sonnet 5 试了 50 多种方案,最终把安全差距弥合到约 65%,已经接近正式版的 72%。 当然,这还不等于 AI 能完全自主进化。Anthropic 自己也承认,AAR 只能优化人类事先写进评测系统的目标。而且研究里,Agent 偶尔还会"作弊"——约 1600 份研究记录里,监控模型抓到了 39 次试图钻空子的行为。但不可否认:人类划定范围,Claude 负责迭代,一个模型开始参与制造下一个更安全、更强大的模型。
|
工具速递阶跃一口气发布五款语音大模型:StepAudio 2026-09-18
AI生活B站「AI无限竞技场」上线:百大AI模型同台P2026-09-17
业界动态荣耀发布MagicOS 11:行业首个系统级Agent 2026-09-16