各厂语言模型

Claude Opus 5 发布:性能追平 Fable 5,价格砍半,编程 Agent 再升级

2026年7月26日3 次阅读
Claude Opus 5 发布:性能追平 Fable 5,价格砍半,编程 Agent 再升级

Anthropic 于7月24日发布 Claude Opus 5。独立评测机构 Artificial Analysis 的测试结果显示,Opus 5 在知识工作基准上超越旗舰 Fable 5 近 150 Elo,而 API 价格仅为一半。在编程和 Agent 场景中,多位早期用户反馈实际表现优于 Fable 5,使其成为当前性价比最高的前沿模型之一。

罕见的周五发布

Anthropic 选择在周五发布 Opus 5,这在业内并不常见。Latent Space 的报道直接用"rare Friday release"来形容这次上线。Opus 5 是 Claude 家族 Opus 系列的最新一代,定位在 Sonnet 5(免费/入门)和 Fable 5(旗舰)之间,但实际表现正在模糊这条界线。

性能:官方"接近 Fable",独立评测"超越 Fable"

Anthropic 官方对 Opus 5 的措辞是"comes close to Fable 5",但独立评测给出了更强的结论:

  • Epoch Capabilities Index (ECI):Opus 5 总分 159,Fable 5 为 161。但在软件工程专项 SWE-ECI 上,Opus 5 拿到 161,与 Fable 5 持平。
  • Artificial Analysis AA-Briefcase:Opus 5 超越 Fable 5 近 150 Elo,同时每任务成本降低 20%。这是知识工作场景的权威基准。
  • GDPval-AA v2 专业交付物基准:Opus 5 得分 1861,领先 Fable 5 的 1747,差距明显。

官方和独立评测之间的差异,部分反映了当前前沿模型评测的困难——不同基准对"能力"的定义不同,而 Opus 5 在某些维度确实已经追上甚至超过了更贵的 Fable 5。

编程和 Agent 能力突出

Opus 5 在编程场景的表现引发了最多讨论:

  • Mikhail Parakhin(前微软高管)在 X 上表示,Opus 5 在 best-of-n 采样下"明显击败 Fable",尤其在数学和综合能力上。
  • 多位用户反馈浏览器操控能力显著提升,有人用 Opus 5 自动打开浏览器取消了 ChatGPT Pro 订阅,评价"这东西真的能驱动浏览器"。
  • Terminal-Bench 2.1 和 LiveBench Coding 排行上,Claude 系列本就领先,Opus 5 进一步巩固了这一优势。

不过也有值得注意的异常:FrontierCode 基准上,Opus 5 在中等推理努力下的得分反而高于高努力,这在其他基准上没有出现。可能的原因包括任务特定的搜索策略差异,或评测本身的不稳定性。

价格:Fable 5 的一半

这是 Opus 5 最直接的竞争力:

| 模型 | 输入价格 | 输出价格 |

|------|---------|---------|

| Claude Opus 5 | $5/1M tokens | $25/1M tokens |

| Claude Fable 5 | $10/1M tokens | $50/1M tokens |

| Claude Sonnet 5 | $2/1M tokens | $10/1M tokens(限时) |

如果独立评测的结论成立——Opus 5 在多数场景接近甚至超越 Fable 5——那么 $5/$25 的定价意味着用户可以用一半的价格获得同等甚至更强的能力。

谁应该关注

  • 开发者:需要强编程能力但不想付 Fable 5 价格的团队,Opus 5 是目前最值得尝试的选择。
  • Agent/自动化团队:浏览器操控和工具调用能力的提升,让 Opus 5 更适合做自动化 Agent。
  • 企业知识工作者:AA-Briefcase 基准的领先说明 Opus 5 在复杂信息处理、报告撰写等场景有优势。

争议与局限

ECI 总分 159 vs Fable 5 的 161,有用户认为这个差距低估了实际体验的提升——"看起来只比 Opus 4.8 高 1 分,但实际用起来好得多"。这反映了当前基准测试的局限:量化差距小,不代表体验差距小。

另外,Opus 5 目前在 Arena 等社区评测平台上的排名尚未完全稳定, leaderboard 分数仍在收集中。如果你需要最权威的横向对比,建议等待 Arena 官方分数出炉。

---

来源:基于 Latent Space AINews 综合报道、Artificial Analysis 独立评测、felloai.com 模型对比数据整理。Anthropic 官方 X 账号 @claudeai 确认了发布。

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...