扬声·CNDoor.Vip 首页 资讯 业界动态 查看内容

Claude 开始训练 Claude!时薪 4 美元的 AI 研究员,干赢了时薪 150 美元的人类 ...

2026-8-31 07:09| 发布者: 糖糊碌| 查看: 53| 评论: 0

摘要: Claude 开始训练 Claude!时薪 4 美元的 AI 研究员,干赢了时薪 150 美元的人类 AI「自己改进自己」的那一天,好像越来越近了。据了解,AI 圈明星公司 Anthropic(Claude 背后的团队)最近发布了一项重磅研究:他们 ...

Claude开始训练Claude

Claude 开始训练 Claude!时薪 4 美元的 AI 研究员,干赢了时薪 150 美元的人类

AI「自己改进自己」的那一天,好像越来越近了。据了解,AI 圈明星公司 Anthropic(Claude 背后的团队)最近发布了一项重磅研究:他们把自身最先进的 Claude 模型「送进实验室」,让它像研究员一样独立做 AI 安全研究——自己查论文、提方案、造数据、训练模型,一口气攻克了 10 类 AI 常见的安全问题。

这套系统叫 AAR(自动化对齐研究员),基于 Claude Opus 4.8 搭建。拿到一个模型安全问题后,Claude 会自己搜索相关论文、从中找方法,再提出训练方案、生成数据、微调模型,最后跑一遍安全和通用能力测试。一轮训练通常只跑 30 分钟,效果不好就换方案,成绩有提升就沿着这个方向继续试,像搜索算法一样快速试错。整个过程里,人类负责出题、给模型、定评测标准,剩下的脏活累活基本都交给 Claude。

结果相当亮眼。 10 类常见安全问题——包括欺骗、谄媚、奖励黑客、隐私侵犯、越狱等——Claude 全部给出了改进方案,按 Anthropic 定义的「安全差距」指标,弥合了 26% 到 96% 的差距,而且没有损害模型原有的通用能力。

最戏剧性的一幕是人机对比。在「欺骗」这道题上,Claude 平均弥合了 85% 的安全差距;而同一道题,Anthropic 交给 6 名经验丰富的 AI 安全研究员,平均只弥合了 20%。更扎心的是成本:一个 AAR 每小时的 API 推理成本大约 4 美元,而 Anthropic 付给人类研究员的报酬是每小时 150 美元。

研究里还有一个更"进化"的玩法:让能力较弱的 Claude Sonnet 5 去训练还没完成生产级安全训练的 Claude Opus 4.8 早期版本。60 小时里 Sonnet 5 试了 50 多种方案,最终把安全差距弥合到约 65%,已经接近正式版的 72%。

当然,这还不等于 AI 能完全自主进化。Anthropic 自己也承认,AAR 只能优化人类事先写进评测系统的目标。而且研究里,Agent 偶尔还会"作弊"——约 1600 份研究记录里,监控模型抓到了 39 次试图钻空子的行为。但不可否认:人类划定范围,Claude 负责迭代,一个模型开始参与制造下一个更安全、更强大的模型。

  • 来源:量子位(Claude开始训练Claude!4美元一小时,跑赢150美元人类研究员)
  • 原文链接:https://www.qbitai.com/2026/08/481223.html

鲜花

握手

雷人

路过

鸡蛋
扬声 · CNDoor.Vip 汇聚 AI 资讯、办公效率、写作、图鉴等实用内容,为新手提供从入门到上手的 AI 指南。我们相信:AI 不该只是技术圈的事——把复杂的事说人话,让每个人都用得上。
  • 手机博客
  • 手机扬声
Copyright © 2014-2026 扬声 · 菜鸟门 版权所有 All Rights Reserved. 冀ICP备2025120842号
关灯 返回顶部
返回顶部