快讯 23:19ARC Prize 2026 赛季揭晓:TUFA Labs 以 88.06% 领跑 ARC-AGI-2 高分榜22:52研究显示:相同AI技术下,男性形象智能体获报酬高于女性形象16:03IMF总裁格奥尔基耶娃:AI若运用得当,有望拉动全球经济年增速0.5个百分点 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期六 · 10-10 14:26 约 1 分钟读完

Cloudflare 发布 Clef-omni 决策模型,开放权重并新增音视频输入支持

摘要

Cloudflare 推出开放权重决策模型 Clef-omni,基于 Qwen3-Omni-30B-A3B-Instruct 构建,支持文本、图像、音频和视频单次 API 调用处理,模型权重已在 Hugging Face 开放。该模型面向结构化决策任务,纯文本请求中位响应时间约 130 毫秒。

Cloudflare 于 10 月 9 日发布公告,正式推出开放权重决策模型 Clef-omni。该模型在 Clef 系列基础上扩展了多模态输入能力,支持通过单次 API 调用处理文本、图像、音频和视频,模型权重已在 Hugging Face 平台开放。

与此前 Clef 仅支持文本、图像及从视频中抽取连续画面的方式不同,Clef-omni 新增了对音频和完整视频输入的支持,兼容 wav、mp3、mp4 和 webm 格式。Cloudflare 表示,开发者无需再单独搭建语音转写或音视频拆分流程,即可用单一模型处理多种输入类型。

技术层面,Clef-omni 基于 Qwen3-Omni-30B-A3B-Instruct 构建,并保留了其主要理解能力。模型定位为结构化决策任务,不生成常规文本输出。根据 Cloudflare 公布的测试数据,纯文本请求的中位响应时间约为 130 毫秒,图像请求约为 150 毫秒;一段带声音的 21 秒视频约 1.5 秒完成评分。

在基准测试中,Clef-omni 在 BFCL 精确匹配率上达到 98.2,ToolRet nDCG@10 为 66.6,API-Bank 准确率为 92.7。相比 Clef 和 Clef-flash,Clef-omni 在部分指标上有所提升,同时保持了较低的响应延迟。该模型的推出进一步降低了开发者处理多模态决策任务的门槛。

CloudflareClef-omni多模态开放权重
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
60
企业落地案例
11
完整版提示词