首页 > 教程资讯 > 教程详情

Cloudflare 发布多模态决策模型 Clef-omni,并下调 Clef-flash 托管价格

AI 与前沿 极客小林 2026-10-11
文章分享

据科技媒体 RuntimeWire 10月9日报道,Cloudflare 工程师 Michelle Chen、Alex Reneau 与 Kevin Jain 把公司的 Clef 决策模型系列扩展到音频和视频,发布 Clef-omni。该模型可在一次 API 请求中接收文本、图片、音频和视频,并对开发者在 schema 里给出的选项返回结构化决策。报道称,这次发布距 Cloudflare 推出首批开源权重的 Clef 与 Clef-flash 过去八天;同一轮更新里,公司还下调了 Clef-flash 的托管价格,并提高了托管 Clef 的服务速度。

一次请求里的音视频决策

RuntimeWire 援引 Cloudflare 10月9日的公告写道,Clef-omni 在文本和图片之外,接受 WAV 或 MP3 音频,以及 MP4 或 WebM 视频。按公告的设计,它在同一次 API 调用里直接给出结构化决策,省去单独的转写和媒体处理步骤。

Hugging Face 模型卡将 Clef-omni 描述为基于 Qwen3-Omni-30B-A3B-Instruct 后训练的 30B-A3B 混合专家模型。推理时使用该基座的理解骨干以及音频、视觉编码器,语音输出组件不加载。模型卡还描述了一个联合 schema 头,把各问题下的允许答案放在一起打分。Cloudflare 称,训练时冻结 Qwen 骨干,加入低秩适配器,并针对校准后的 schema 决策进行调优。因此,模型处理媒体后直接给允许的答案打分,而不是先生成转写或字幕、再交给另一个模型解读。

报道把这种用法和通用模型区分开来:Clef 不对自由生成的文本再做解析,而是为 schema 中提供的选项返回概率。文中列举的用途包括路由客服请求、分类安全事件,以及为 agent 选择动作。RuntimeWire 写道,这使 Clef 背后的团队在“于预先定义的动作、类别或取值之间做决定”这一范围内,与 TypeSafe 的 Jev 形成直接竞争。

报道还回顾了首批模型的发布时间表。Cloudflare 在最初公告中说,进入这一品类的决定是在一个周五晚上作出的,训练在周末进行,产品于周四上线。

延迟与基准均为发布方自测

Cloudflare 自称,文本请求的中位响应时间约 130 毫秒,图片输入约 150 毫秒,音频为几百毫秒;一段 21 秒、带声音的视频大约 1.5 秒完成评分。RuntimeWire 注明,这些是公司自报数字,已公开材料没有对客户负载上的准确率或延迟提供独立测试。

基准表同样来自 Cloudflare 自己的评测,报道强调它不是独立审计。Clef-omni 在 BANKING77 上的 macro-F1 为 94.8,在 CLINC150+OOS 上为 97.7;在若干其他列出的测试上则低于原有 Clef。在 Cloudflare 的 TypeSafe 工作流测试中,发票处理的精确动作得分,Clef-omni 为 60.2,Clef 为 64.7,Jev 为 61.8。

更低的托管价格和更短的上下文

Cloudflare 将 Clef-flash 的托管输入价格从每百万 token 0.09 美元降到 0.038 美元。RuntimeWire 查阅当时的 Workers AI 定价页,其中 Clef 为每百万输入 token 0.24 美元,Clef-omni 为 0.15 美元。Cloudflare 称 Clef-omni 现在比 Jev 更便宜;RuntimeWire 同时写明,这一比较取决于所适用的 Jev 价格和工作负载。

降价伴随着托管上下文缩短。Clef-flash 的托管上下文窗口从 64,000 token 减到 24,000 token。Cloudflare 称,其 Clef-flash 请求中有 0.24% 的输入超过 24,000 token。已发布的模型权重没有变化;公司表示,自行部署这些开源权重可以使用 256,000 token 的上下文窗口。

Cloudflare 还称,托管 Clef 在服务层优化之后最高快 2.0 倍,这次提速没有发布新的 Clef 权重。报道另引公司此前的说法:Cloudflare 在内部威胁情报工作中使用 Clef 做域名分类。

来源