Cloudflare开源多模态AI模型 能直接处理音视频

开发者过去要让机器判断一段带声音的视频,往往得先把语音转成文字、把画面拆成图片,再分别送进不同模型。现在这套流程可以压成一次调用:文字、图片、音频、视频一起交给同一个模型,官方实测一段 21 秒带声视频约 1.5 秒完成评分。模型权重已开放下载,可自行部署。

据 Cloudflare 当地时间 10 月 9 日发布的公告,这家公司推出了开放权重决策模型 Clef-omni,支持单次 API 调用处理文本、图像、音频和视频。该系列此前已有只支持文本、图像以及视频抽帧的版本 Clef,与其轻量版 Clef-flash 一起在上周发布。

多模态输入是这一版最大的变化。音频支持 wav、mp3 格式,视频支持 mp4、webm 格式,开发者无需另行搭建语音转写和音视频拆分流程。Clef-omni 属于决策模型而非生成式聊天模型,它不输出成段的文字,而是对开发者给定的候选选项逐一打分,例如判断设备铭牌在照片中是否可见、运转声音是否异常、视频里的风扇是否在转。

技术底座方面,Clef-omni 基于阿里千问 Qwen3-Omni 构建,采用 30B-A3B-Instruct 混合专家版本,保留了多模态理解能力,去掉了文本转语音输出部分。训练时 Cloudflare 冻结了千问主干,只训练低秩适配器。官方公布的响应时间为:纯文本约 130 毫秒,图像约 150 毫秒,带声的 21 秒视频约 1.5 秒。

价格与规格同步调整。Clef-flash 每百万输入 Token 的价格从 0.09 美元降到 0.038 美元,降幅约 58%,托管版上下文窗口从 64k 缩减到 24k;Cloudflare 表示自托管权重仍支持 256k,并称其观察到的请求中超过 24k 的仅占 0.24%。Clef 维持 0.24 美元每百万 Token 与 64k 上下文不变,迁到 SGLang 后中位延迟最高降低 2 倍。

在应用层面,Cloudflare 列出的内部用例包括:处理 GitHub 文档仓库里的垃圾 issue、为旗下 EmDash 内容管理系统的插件库做钓鱼链接审核、扫描个人信息、识别恶意域名。Clef 与 TypeSafe 的 Jev 模型保持 API 兼容,并通过 Cloudflare 的 AI Gateway 对外提供。

信息来源:IT之家

免责声明:本站转载的文章,版权归原作者所有;旨在传递信息,不代表本站的观点和立场。

上一篇 2026年10月9日 15:42
向海图强、深地突破、星际远航!奋进“十四五”高水平科技自立自强跑出“加速度”
下一篇 2025年10月15日 11:37

相关推荐