Sakana AI 发布 Fugu Max 与 Fugu Ultra v2:不造更大的模型,而是学会调度一堆模型
Sakana AI 发布 Fugu Max 与 Fugu Ultra v2:不造更大的模型,而是学会"调度一堆模型"
这是什么?为什么值得关注?
过去十年,AI 行业基本在沿着一条轴赛跑:把模型做得更大、更贵。但 Sakana AI 认为真正重要的前沿是二维的——能力一轴,成本一轴。用一个多万亿参数的大模型去查一条数据,不是智能,是浪费。
Fugu 的思路是:让系统自己判断该派哪台"机器"去干活。简单任务路由给轻量开源模型,复杂任务才动用重装火力。这次的两个新品是同一套编排架构的两种取向:
- Fugu Max:在最低成本下做到最好的输出——面向预算敏感的日常与编码负载。
- Fugu Ultra v2:在复杂多步任务上冲到能力天花板——面向自主研究、全栈开发这类硬活。
Fugu Max:更多模型,更少花钱
Fugu Max 整合了迄今最大规模的模型池,包括通过与 NVIDIA 合作接入的 Nemotron 开源系列。它把任务动态路由给"能解决它的最便宜模型",官方给出的关键数据:
在 10 项基准中,Fugu Max 有 7 项扩展了"成本-性能效率前沿"(Pareto frontier)——也就是说,在同等价格档位里,目前没有单一模型能同时做到它的性能和成本。
Fugu Ultra v2:不靠闭源巨兽,也能冲到前沿
旗舰档的 Fugu Ultra v2 主攻持续推理、复杂视觉与结构化数据。官方强调一个关键点:它的模型池里没有 Fable 5、Fable 5.1 和 GPT-6 Astra——也就是说,这些成绩不是靠调用别人的闭源前沿模型刷出来的。
- 8 项基准中 5 项最佳或并列最佳:GDP.pdf、Chartography、SWEFish、DeepSWE、Toolathon;8 项中 7 项进前二。
- Chartography(视觉推理与数据解读)拿下 48.3 分,对比 Opus 5 的 27.3 和 Fable 5 的 29.5。
- DeepSWE(真实软件工程)74.3 分,超过单价贵 3-5 倍的模型。
对企业的实际意义是:编排一个可替换的开源模型池,既能对抗厂商锁定、API 被 revoke、区域服务中断这类风险,又不用在能力上妥协太多。
怎么用?多少钱?
作为参照,Fugu 从 4 月的 beta、6 月正式商用 + Ultra v1、7 月的网络安全特化版 Fugu-Cyber、8 月的 Sakana Chat 与 NVIDIA 合作,到今天的 Max / Ultra v2,一年内走完了从论文设想到企业级产品的路。
对你的意义
如果你是开发者:Fugu Max 给了"前沿级编码/Agent 能力、1/2 到 1/6 价格"的新选项,尤其适合大批量自动化任务。如果你在企业里做技术选型:开源模型编排这条路,第一次在硬基准上证明了自己不必依赖闭源巨兽。对普通读者一句话:AI 竞赛的叙事,可能正在从"谁造的模型最大"转向"谁最会调度一堆模型"。