大语言模型

Anthropic 发布 Claude Opus 5.5:首个 5.5 家族模型,性能逼近 Fable 5.1,成本比 Opus 5 低 40%

2026年9月23日1 次阅读
Anthropic 发布 Claude Opus 5.5:首个 5.5 家族模型,性能逼近 Fable 5.1,成本比 Opus 5 低 40%

9月22日,Anthropic 官方发布 Claude Opus 5.5。这是 Claude 5.5 家族的首个模型,官方口径是:在大多数任务上达到 Claude Fable 5.1 的水平,但运行成本比 Opus 5 低 40%。基于多家媒体转述整理,本次更新的核心不是"再做一个更强的旗舰",而是把旗舰级能力打到一个更低的价格带。

这次更新最重要的三点

1. 性能接近上一代旗舰,价格明显下探

Opus 5.5 被定位为 5.5 家族的第一款模型。官方称它在多数工作上的表现与 Claude Fable 5.1 相当,但运行成本比 Opus 5 低 40%。多家媒体同时报道了"接近 Fable 5.1 表现、更便宜的 API 价格"这一口径,说明这不是单一渠道的说法。

2. 复杂工程任务提升明显,官方给了三个具体例子

  • 代码迁移:一位测试者让它在不到一天内完成了 68 万行代码的迁移——官方称这种工作量对工程团队来说通常要几周。
  • 网页性能优化:要求它对 Web 应用每个页面压缩加载时间,Opus 5.5 在 40 次里 39 次成功;而 Opus 5 虽然也有改进,但会顺带改变应用行为,属于"修一个地方坏一个地方"。
  • 单提示词做游戏:多位测试者让不同 Claude 模型只用一条提示词生成游戏,Opus 5.5 在画面表现和完成度上得分最高。

3. 安全对齐:官方称是它测过最强的模型

Anthropic 说,在他们最全面的自动化行为审计(alignment suite,数千个模拟场景)中,Opus 5.5 是迄今表现最强的模型:更难做出难以撤回的动作,更不容易越出给定边界,比 Opus 5 更抗提示注入。由于 Opus 5.5 在生物和网络安全上的表现与 Claude Mythos 5.1 相当,官方会为它部署与 Fable 5.1 同级别的安全防护,并开放生命科学验证计划(Vetted 组织可申请用于生物研究)。

对普通用户意味着什么

如果你主要跑简单问答,这次更新感知不大。真正受益的是做复杂编码、长任务 Agent、代码库级迁移和性能优化的开发者:用比旗舰便宜一档的价格,换来接近旗舰的复杂任务表现,是这次发布最直接的卖点。对 Agent 工作流来说,"抗注入更强 + 更少做不可逆动作"也是官方主打的方向。

边界与限制

官方说明行为审计仍有边界,扩展到的长任务、不可行任务等场景"仍有局限";完整评测细节要看 Opus 5.5 System Card。第三方独立基准的横向对比仍在陆续补全中,目前主要依据官方博客与多家媒体的发布报道。

来源

  • Anthropic 官方发布页:https://www.anthropic.com/news/claude-opus-5-5
  • MarkTechPost(2026-09-22):https://marktechpost.com/2026/09/22/anthropic-claude-opus-5-5-release
  • VentureBeat(2026-09-22):https://venturebeat.com/technology/anthropic-releases-claude-opus-5-5-beating-fable-5-1-on-key-agentic-benchmarks-at-60-cheaper-ap

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...