语音模型

Cloudflare 开源 Clef-omni:决策模型学会「听」音频了,一次前向直接出结构化判断

2026年10月11日2 次阅读
Cloudflare 开源 Clef-omni:决策模型学会「听」音频了,一次前向直接出结构化判断
📅 2026-10-09 官方发布 | 📊 来源:Cloudflare 官方博客 · Hugging Face

先说清楚这是什么:上周刚开源决策模型 Clef 和 Clef-flash 的 Cloudflare,10 月 9 日又发新品 Clef-omni。这一次,决策模型补上了音频和视频两块拼图——它能直接「听」wav/mp3 音频、「看」mp4/webm 视频,然后在一个模型里输出结构化的判断结果,权重已以 Apache-2.0 协议在 Hugging Face 开源。

🎯 核心亮点速览
  • 全模态输入:文字、图片、音频(wav/mp3)、视频(mp4/webm)一网打尽,不用再搭「转文字→分类」级联管线
  • 只出决策、不跑题:一次前向计算直接输出每个预定义选项的概率,没有自由文本生成
  • 发布即降价:Clef-omni 定价 $0.15/百万输入 tokens,Clef-flash 降价超一半至 $0.038
  • 权重开源:Apache-2.0 协议,SGLang 0.5.22 将原生支持,可自部署

「决策模型」是个什么物种?

它和 ChatGPT 这类聊天模型完全是两种东西:不做自由文本生成。你给它一份输入(现在可以是文字、图片、音频或视频)和一组预定义的问题选项,它一次前向计算就直接输出每个选项的概率——不需要解析生成文本,也不存在模型「跑题」的问题。

比如给一段客服录音和一份质检问题清单(「用户情绪是否负面?是否提到竞品?」),它一口气把所有问题的概率都算出来。官方给它的定位是把「检测和分类」这件事搬进模型层,让普通开发者调用一个 API 就能完成过去需要专门机器学习团队训练零样本分类器才能做的活。

技术底细:Qwen3-Omni 底座 + 联合打分头

Clef-omni 基于 Qwen 的 Qwen3-Omni-30B-A3B-Instruct(30B 参数、每次激活 3B 的 MoE 架构)做后训练,保留了底座的视觉和音频编码器。模型里加了一个「联合 schema 头」——一个小型 transformer,负责把输入内容路由给每个问题、给所有问题的所有选项一次性打分。

值得一提的是,底座自带的语音输出权重(talker 和 code2wav)原封不动保留在权重文件里,但托管版不会加载——这是个「只听不说」的判断模型。

Clef-omni 官方配图

价格:发布即降价,老模型也提速

模型价格(每百万输入 tokens)上下文窗口备注
Clef-omni$0.15(今日上线)—新增音频/视频输入
Clef-flash$0.09 → $0.03864k → 24k比同类 Jev 更便宜
Clef$0.24(不变)64k托管端提速约 1.7-2×

Clef-flash 缩窗口的代价换来更低的门槛价,官方数据显示只有 0.24% 的请求输入超过 24k tokens。Clef 本体的提速来自切换到 SGLang 推理框架(3400 tokens 输入的延迟中位数从 616ms 降到 305ms),模型权重没变。

💡
提示:需要长上下文的别选缩水后的 Clef-flash,官方建议直接换 Clef。

开源信息:怎么自己跑

  • Hugging Face:搜 Cloudflare/clef-omni 拿权重,同日还有 Clef / Clef-flash 权重页更新(SGLang 启动命令已加进 README)
  • 协议:Apache-2.0,商用无障碍
  • SGLang:相关 PR 已合入,0.5.22 版本将原生支持;官方还提供了 cookbook
  • 托管版:已在 Workers AI 上线,开发者文档可直接调用
📋 它能读什么、输出什么(官方口径)

输入:状态信息可以是文本、JSON、图片、音频或视频;外加一份带类型的「问题 schema」。输出:单次前向,为每个问题的每个允许选项输出一个 logit,逐问题做 softmax 得到概率。API 与 Jev、SystemOne 完全兼容。

谁该关注

  • 做通话/音频质检的团队:不用再搭「ASR→文本分类」流水线,一个模型直接出结构化结果,也少了转写出错连带下游全错的环节
  • 内容审核/合规场景:音视频直接进模型,按预设问题出概率,方便接进自动化流程
  • 想省成本的评审者:Clef-flash 降到 $0.038/M tokens,轻量分类场景值得比一比

一句话总结:决策模型这个新物种从「只能看字」进化到「能听能看」,而且开源、便宜、不跑题——如果你的业务要从音视频里出结构化判断,它值得进候选清单。

📚 参考来源

本文由加装AI助手整理发布 | 数据来源:Cloudflare 官方博客、Hugging Face 模型页

评论

0 条已公开
登录或注册后可以参与评论。

正在加载评论...