各厂语言模型

智谱 Z.ai 发布 GLM-5.3-Flash 与 FlashX:首个原生多模态 GLM,百万 token 上下文,Coding Plan 配额翻三倍

2026年9月20日13 次阅读
草稿:Z.ai 发布 GLM-5.3-Flash 与 FlashX

草稿:Z.ai 发布 GLM-5.3-Flash 与 FlashX

---

基于多家媒体转述整理

标题

智谱 Z.ai 发布 GLM-5.3-Flash 与 FlashX:首个原生多模态 GLM,百万 token 上下文,Coding Plan 配额翻三倍

正文

9月17日前后,Z.ai(智谱)连发两款新模型:GLM-5.3-Flash 和 GLM-5.3-FlashX。这两款模型在 GLM-5 系列里第一次把"多模态"和"百万 token 长上下文"组合在一起,同时 Z.ai 还调整了 Coding Plan 的配额规则——订阅用户能拿到 3 倍于 GLM-5.3 的 Flash 用量。

对写代码、处理长文档、做视频理解的人来说,这次更新的意义挺直接:更便宜的长上下文推理,不再需要"要么省钱要么够用"。

Flash 和 FlashX 有什么区别?

两个模型共用同一套参数结构,但定位不同:

  • GLM-5.3-Flash:完整功能版。输入支持视频、图片、文本、文件四种模态,输出文本,上下文窗口 100 万 token。参数规模 3200 亿(总)/ 180 亿(激活),MoE 架构。Z.ai 在说明里提到,长提示下的注意力计算和缓存成本有"显著降低",意味着同样跑 100 万 token,比上一代更省钱。
  • GLM-5.3-FlashX:Flash 的"提速版",主打低延迟响应,适合对响应速度敏感的场景(如实时对话、在线 API 服务)。但 FlashX 目前只对 API 用户开放,没有进入 Coding Plan 订阅。

两个模型的 API 调用标识分别是 glm-5.3-flashglm-5.3-flashx,均已上线 OpenRouter 等第三方平台。

Coding Plan 有什么变化?

Z.ai 的 Coding Plan 是其面向开发者的订阅服务,按月度提供模型调用配额。这次调整后:

  • GLM-5.3-Flash 的配额 = GLM-5.3 的 3 倍——订阅用户可以用更少的钱跑更长的上下文、处理更多多模态任务
  • FlashX 被排除在 Coding Plan 之外,只能通过 API 按量计费

换句话说,如果你主要做批处理、长文档分析、代码库理解,订阅 Coding Plan 划算;如果你需要极低延迟的实时响应,只能走 API 付费。这是 Z.ai 在"容量"和"速度"之间做的一个产品分层决策。

为什么值得关注?

GLM-5.3-Flash 的"多模态 + 百万上下文 + 低成本"组合,在当前开源/低价大模型竞争格局里相当有竞争力:

  • 百万 token 上下文意味着可以一次性处理整本书或整个代码仓库,而不用手动切分
  • 多模态输入支持让视频、图片理解不再需要单独的视觉模型
  • 320B 总参数 / 18B 激活的 MoE 结构,推理成本远低于全参数激活的同级别模型

几乎同一时间,月之暗面 Kimi K3 也登上了亚马逊 Bedrock(2.8 万亿参数),国产大模型在"大参数 + 云服务上架"这条线上同时发力,价格竞争还在加速。

怎么用上?

  • API 调用glm-5.3-flash / glm-5.3-flashx,支持 OpenRouter、Vercel AI Gateway 等主流平台
  • Coding Plan 订阅:Flash 配额已生效(3 倍),FlashX 暂不开放
  • 本地部署:320B 总参数,18B 激活,理论上可量化后在单卡/多卡部署,但多模态部分需要完整权重

限制与注意

  • FlashX 目前仅 API 可用,订阅用户无法直接调用
  • Z.ai 称"注意力成本显著降低",但没有公开具体数字,实际效果需要自己跑基准测试确认
  • 多模态输入(视频)的帧率、分辨率上限尚未在媒体转述中明确,建议查官方文档

---

*来源:基于 Superpower Daily、OpenRouter 模型页、pricepertoken 等多方转述整理,发布时间约为 2026年9月17-18日。*

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...