Mira Murati 首秀:Thinking Machines 发布 Inkling,975B 开源多模态模型+可调推理深度
前 OpenAI CTO Mira Murati 创办的 Thinking Machines 今日发布首个开源多模态语言模型 Inkling。这是一款 975B 总参数的 Mixture-of-Experts(MoE)模型,41B 活跃参数,原生支持文本、图像和音频三种模态,上下文窗口达 100 万 token,预训练数据量 45 万亿 token。权重已在 HuggingFace 上线,采用 Apache 2.0 协议。
可调推理深度:让模型按需"思考"
Inkling 最大的技术亮点是"可调推理深度"(controllable thinking effort)。开发者可以在 0.2 到 0.99 之间编程设定模型的推理预算——简单任务调低,省 token、省算力;复杂任务调高,换取更深层的推理链。Thinking Machines 称,训练过程中观察到一个有趣现象:"思维链浓缩"(chain of thought condensation)——模型随着训练推进,自然学会压缩内部推理步骤,在更少的 token 中保留关键逻辑。
这意味着企业部署时不再需要在"强但贵"和"便宜但弱"之间选模型,而是用一个模型覆盖不同复杂度的任务。
性能:开源阵营前列,闭源前沿仍有差距
Inkling 的定位不是刷榜冠军,而是"广而平衡的实用底座":
- 编码:SWE-bench Verified 77.6%,超过美国开源对手 Nemotron 3 Ultra(71.9%),但低于 DeepSeek V4 Pro(80.6%)和闭源的 Claude Fable 5(95.0%)
- 数学:AIME 2026 达 97.1%,超过 DeepSeek V4 Pro(96.7%)和 Nemotron 3(94.2%)
- Agent 能力:MCP Atlas 74.1%,远超 Nemotron 3 的 44.7%
- 多模态:MMMU Pro 视觉基准 73.3%,MMAU 音频基准 77.2%,与闭源模型差距缩小但仍落后
在开源阵营中,GLM 5.2 和 Kimi K2.6 在纯推理和编码上仍占优势,但 Inkling 是目前开源模型中唯一原生融合文本+视觉+音频的选项。
抗审查设计:面向企业可控需求
Thinking Machines 明确表示 Inkling 被设计为"直接回答可能受到审查的话题"。这一设计选择针对的是企业用户对事实输出可控性的需求——不论话题敏感与否,模型应提供事实性回应。这与主流闭源模型倾向拒绝敏感问题的策略形成差异。
同时发布 Inkling-Small 预览
除旗舰模型外,Thinking Machines 还发布了 Inkling-Small 的预览版——276B 总参数、12B 活跃参数的轻量版,针对低延迟、低成本场景优化。
行业意义
Mira Murati 2024 年离开 OpenAI 后创办 Thinking Machines,Inkling 是其团队交出的第一份答卷。975B 参数+原生多模态+可调推理深度+Apache 2.0 全开源的组合,在当前开源模型竞争中打出了差异化牌:不追求单点最强,而是做企业最愿意拿来定制的基础模型。可调推理深度如果被验证有效,可能改变企业部署 AI 的成本范式——用一套模型,按任务难度动态分配算力。
基于多家媒体转述整理。