Cloudflare 发布多模态决策模型 Clef-omni,并下调 Clef-flash 价格
重点概览
Cloudflare 扩展了其开放权重决策模型 Clef 系列,新增 Clef-omni,可在单一流程中原生处理 音频、视频、图像和文本。同时,Clef-flash 降价,Clef 的托管推理速度也有所提升。
主要变化包括:
- 新增 Clef-omni:支持 wav、mp3、mp4、webm,以及文本和图像输入。
- Clef-flash 输入价格从每百万 token 0.09 美元降至 0.038 美元。
- Clef 托管版本推理速度提升,部分输入规模下中位延迟最高约 2.0× 改善。
- Clef-flash 托管版上下文窗口从此前宣传的 64k 调整为 24k;自托管权重未变,训练支持 256k 上下文。
Clef-omni:面向音频、视频、图像和文本的决策模型
Clef-omni 是 Clef 系列的新成员,定位为多模态决策模型。此前的 Clef 已支持图像和视频帧数组,而 Clef-omni 进一步加入了对音频和视频文件的原生处理能力。
这意味着,在某些工作流中,开发者不再需要先搭建多级流水线,例如:
- 先用语音识别模型把音频转成文本;
- 再把视频拆成音频和图像帧;
- 最后交给另一个模型进行分类或决策。
Clef-omni 的目标是让模型直接在一个 API 调用中处理多种输入模态,并基于统一上下文输出结构化决策结果。
模型架构与训练方式
Clef-omni 基于 Qwen3-Omni-30B-A3B-Instruct 混合专家模型基础构建。该基础模型本身具备处理文本、图像、音频和视频的能力。
Cloudflare 表示,Clef-omni 采用其主要理解主干,但移除了文本转语音输出组件。由于 Clef 系列并不是传统意义上的大语言模型,不需要生成长文本输出,因此可以跳过输出 token 生成带来的开销。
其处理流程包括:
- 对完整输入载荷执行快速 prefill;
- 同时对各模态输入和候选参数选项进行评分;
- 将媒体元素映射到统一序列中;
- 将视频、音频与视觉帧同步处理;
- 通过两阶段注意力路由,从输入中提取候选值相关证据;
- 使用内置词法语法保留选项语义,实现受 schema 约束的评分。
训练方法与此前 Clef 类似:
- 冻结 Qwen3 主干;
- 训练低秩适配器 LoRA;
- 使用标签平滑交叉熵损失;
- 结合 Brier score 校准。
官方描述称,这样做是为了增强模型对 schema 变化、字段顺序变化和提示结构变化的鲁棒性。
延迟表现
Cloudflare 给出的 Clef-omni 延迟数据如下:
| 输入类型 | 延迟表现 |
|---|---|
| 纯文本决策 | 中位约 130 ms |
| 图像输入 | 中位约 150 ms |
| 音频片段 | 数百毫秒 |
| 21 秒带声音视频 | 约 1.5 秒 |
这些数据均针对单次 API 调用场景。
基准测试表现
Cloudflare 公布了 Clef-omni、Clef、Clef-flash 与 Jev 在多个基准上的对比。部分结果如下:
| Benchmark | Clef-omni | Clef | Clef-flash | Jev |
|---|---|---|---|---|
| BFCL · case exact | 98.2 | 98.47 | 98.76 | 95.75 |
| ToolRet · nDCG@10 | 66.6 | 69.19 | 66.43 | 65.28 |
| API-Bank · accuracy | 92.7 | 91.93 | 93.11 | 88.19 |
| Home appliances · case exact | 69.3 | 82.95 | 97.73 | 52.27 |
| When2Call · accuracy | 63.3 | 72.37 | 65.58 | 80.97 |
| BANKING77 · macro-F1 | 94.8 | 94.20 | 90.93 | 79.74 |
| CLINC150+OOS · macro-F1 | 97.7 | 97.43 | 66.77 | 89.27 |
| BRIGHT · nDCG@10 | 42.0 | 45.91 | 39.26 | 47.52 |
| Amazon ESCI · macro-F1 | 57.8 | 57.48 | 57.39 | 55.21 |
| PhishNChips · accuracy | 73.2 | 79.60 | 75.05 | 62.55 |
另一个面向工作流的评测结果如下:
| Workflow | Metric | Clef-omni | Clef | Clef-flash | Jev |
|---|---|---|---|---|---|
| Invoice processing | Exact actions | 60.2 | 64.7 | 57.1 | 61.8 |
| Invoice processing | Primary action | 82.0 | 86.2 | 73.3 | 83.1 |
| Customer service | Exact actions | 71.6 | 76.3 | 77.0 | 76.0 |
| Security incidents | Exact actions | 61.7 | 62.9 | 61.7 | 61.7 |
| Agent trace observability | Primary action | 65.8 | 68.5 | 69.8 | 71.6 |
从公开结果看,Clef-omni 在部分分类和意图识别任务上表现较强,但并非所有任务都领先;在一些工作流评测中,Clef 或 Jev 仍有更高分数。
Clef-flash 降价,但托管上下文窗口缩小
Clef-flash 的价格被下调:
| 模型 | 输入价格 |
|---|---|
| Clef-flash | 每百万输入 token 0.038 美元 |
| Clef | 每百万输入 token 0.24 美元 |
| Clef-omni | 每百万输入 token 0.15 美元 |
Clef-flash 此前价格为每百万输入 token 0.09 美元。此次降价伴随一个取舍:托管版上下文窗口从此前宣传的 64k 调整为 24k。
Cloudflare 表示,根据使用数据,只有 0.24% 的请求超过 24k 输入 token,因此将托管版 Clef-flash 的上下文窗口降至 24k,以换取更低价格。需要更大上下文的用户可选择 Clef;自托管 Clef-flash 的模型权重未变,训练支持 256k 上下文窗口。
Clef 托管推理速度提升
Clef 托管版本也进行了推理优化。Cloudflare 表示,这些优化主要发生在服务基础设施层,而不是模型权重或架构层,因此没有发布新权重。
延迟对比如下:
| 输入规模 | 优化前中位 / p95 | 优化后中位 / p95 | 中位速度提升 |
|---|---|---|---|
| 约 800 tokens | 262 / 438 ms | 152 / 351 ms | 1.7× |
| 约 3,400 tokens | 616 / 777 ms | 305 / 531 ms | 2.0× |
| 约 16,000 tokens | 2,721 / 3,250 ms | 1,635 / 1,805 ms | 1.7× |
其中一项优化是切换到 SGLang 进行模型服务。Cloudflare 表示,其与 SGLang 团队合作提交了对 Clef 的支持,相关改动计划进入 SGLang 0.5.22。
适用场景观察
Clef 系列的定位不是通用聊天模型,而是面向结构化决策、分类、路由和工具选择等场景。Clef-omni 的新增能力使其更适合包含多模态输入的工作流,例如:
- 客服对话中的语音、截图和文本联合判断;
- 安全事件中的日志、截图、录音或视频片段分类;
- 发票、票据、商品图片与文本字段联合处理;
- Agent 工作流中的工具选择、动作判断和路由决策。
需要注意的是,公开基准显示不同模型在不同任务上各有优势。Clef-omni 的价值主要在于单模型多模态输入和 schema 约束决策,而不是在所有文本任务上全面替代 Clef 或 Clef-flash。
