Claude Opus 5.5 发布:一天迁移 68 万行代码,单任务成本只要对手两成据官方消息,9 月 22 日,Anthropic 发布了 Claude Opus 5.5,这是 Claude 5.5 系列的第一款模型,距离上一代 Opus 5 只隔了大约两个月。Anthropic 称,它在多数工作中的表现已经达到自家更强一档的 Claude Fable 5.1 水平,但完成典型任务的成本比 Opus 5 低了约 40%。 先说最直观的:写代码更快更省据披露,一位早期测试者用 Opus 5.5 做了一项涉及 68 万行代码的迁移任务,全程不到一天;如果交给工程团队手动处理,可能要花上数周。另有测试要求它把某个网页应用所有页面的加载时间降下来,40 次测试里成功了 39 次,而上一代不但改进幅度小,有时还会改坏应用原有的行为。 成本上的差距更明显。在 FrontierCode 这类考察编程 Agent 的测试中,Opus 5.5 完成每项任务的成本大约只有 GPT-6 Astra 的两成;在 Terminal Bench 4.0 上约为 Astra 的四成、性能却能打平。 不只是写代码:写报告、做财务分析也变强了据官方介绍,在一项覆盖 44 个职业的真实工作测试里,Opus 5.5 的 Elo 得分达到 1846 分,高过 Fable 5.1 和 Opus 5。让几款模型仅凭网上公开信息撰写一份难查的季度业绩报告时,Opus 5.5 交出的 18 份里有 16 份达标(系统会逐条核对数据和引文,编造即不合格),而另外两款一次都没过。 投资机构 Walleye Capital 反馈,Opus 5.5 在最低设置下就基本解决了他们的评估套件,更高设置下甚至发现并修正了评估说明里的一个错误——这是此前没有任何模型做到过的。 价格降了两成,速度还快了三成据了解,Opus 5.5 的 API 输入价为每百万 Token 4 美元、输出 20 美元,均比 Opus 5 降了 20%;缓存读取从 0.5 美元降到 0.2 美元,降幅 60%。官方特别说明,「总成本降 40%」是单价下调叠加「用更少步骤和 Token 完成任务」算出来的,并非所有单价都降四成。另外它输出速度比上一代快 30% 以上,Anthropic 也上调了订阅用户的五小时使用额度。 值得一提的是,这是 Anthropic 首席执行官 Dario Amodei 提出「控制前沿推进节奏」之后发布的首款模型,发布前经过了外部机构测试。由于在生物和网络安全上的能力增强,部分高能力功能需要经过组织和人员验证才能使用。有消息称,更轻量的 Sonnet 5.5 和 Haiku 5.5 也将在未来几周发布。 来源:InfoQ《Claude Opus 5.5 发布:一天内迁移 68 万行代码,单任务成本比 GPT-6 Astra 便宜 80%》 原文链接:https://www.infoq.cn/article/jG9ksSRvpkfP20Qif8Ov |
业界动态苹果的隐私高墙,被 Meta AI 助手借道绕过2026-10-09
业界动态《怪物史莱克》编剧也来了:这家影视公司做2026-10-08
业界动态Manus 回来了:2.0 上线自研框架 Cascade,2026-10-07