各厂语言模型

阿里通义千问发布 Qwen3.8-Max:2.4万亿参数 MoE 新旗舰,百万上下文,下周开源

2026年8月4日3 次阅读
阿里通义千问发布 Qwen3.8-Max:2.4万亿参数 MoE 新旗舰,百万上下文,下周开源

阿里通义千问团队于8月3日正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强大的语言模型。它采用 2.4 万亿参数的混合专家(MoE)架构,每次推理激活 950 亿参数,支持百万 token 上下文窗口,Agent 能力较前代大幅跃升。API 已在阿里云百炼平台和 QwenChat 上线,开放权重承诺下周放出。

核心参数一览

Qwen3.8-Max 是一个 2.4T 参数的 MoE 模型,活跃参数 950 亿。它接受文本、图像和视频输入,输出文本。上下文窗口达到 100 万 token,最大输入 99.1 万 token(开启思考模式后为 98.3 万),最大输出 13.1 万 token,推理预算上限 26.2 万 token。

API 定价为每百万输入 token 2 美元、每百万输出 token 6 美元,缓存输入仅 0.25 美元——比新输入便宜 8 倍。这意味着如果你的提示词前缀稳定,长上下文的实际成本远低于标价。

模型原生支持 function calling、structured output、前缀补全和微调,并在 Responses API 中内置了 5 个工具:代码解释器、网页搜索、网页提取、文搜图和图搜图。

Agent 能力跃升是最大看点

Qwen3.8-Max 最显著的进步不在传统推理,而在 Agent 和多模态方向。

代码 Agent 方面,DeepSWE 1.1 得分从 Qwen3.7-Max 的 21.6 跳到 56.6,FrontierSWE 从 40.7 升至 73.5,JobBench 从 31.3 升至 53.4。Terminal-Bench 2.1 得分 86.6,超过了 Claude Opus 4.8 和 Claude Fable 5 的 84.6(仅次于 GPT-5.6 Sol 的 88.8)。

推理方面,GPQA Diamond 为 92.6,较 Qwen3.7-Max 的 92.4 仅微升。PaperBench 93.0 和 IFBench 82.8 表现领先。

多模态方面,OSWorld-Verified 86.1、Parametric CAD Bench 91.5、OmniDocBench 92.1,在视觉理解基准上全面领先。

不过有两点需要注意:部分多模态基准对比的是 Qwen3.7-Plus 而非 Qwen3.7-Max,代际提升幅度因此被放大;此外阿里自己的 RL scaling 曲线显示,训练环境数超过 4000 后性能开始下降。

开放权重下周放出

阿里确认 Qwen3.8-Max 和 Qwen3.8-27B 的开放权重将在下周发布。2.4T 参数的完整模型需要多节点数据中心级硬件才能部署,官方尚未公布活跃参数数的具体细节,自部署成本暂时无法精确估算。对于大多数本地部署场景,27B 版本才是现实选择。

阿里云百炼个人版已将 qwen3.8-max 标记为 NEW,并提供限时优惠:夜间(北京时间 22:00-08:00)调用享 5 折,preview 版本更有 10 倍用量优惠。

适合谁用?

  • 软件工程师:仓库级代码 Agent、自动化修复和重构
  • 法律和金融从业者:长文档知识库、合同审查、报告分析
  • 电商和媒体运营:长视频索引、结构化数据提取
  • 研究人员:多步研究助手、论文综述

Qwen3.8-Max 的 API 兼容 OpenAI 和 DashScope 接口,迁移只需改 base URL 和 model ID。

小结

Qwen3.8-Max 是阿里在开源大模型赛道上的一次重要回归。2.4T MoE + 百万上下文 + Agent 能力跃升 + 下周开源,组合拳相当有诚意。定价也延续了国产模型的性价比传统。如果你在寻找一个能跑长上下文、Agent 能力强、且即将开源的模型,Qwen3.8-Max 值得关注。

---

*基于 MarkTechPost、南华早报、阿里云帮助中心等多源信息整理。*

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...