阿里千问五款语音模型发布 语音服务价格最高降95%

会议记录、采访整理、视频配音这类活儿正越来越多地交给 AI,而处理音频要花多少钱,直接决定用不用得起。9 月 23 日,阿里千问把语音能力整体升级到 Qwen-Audio-3.1,覆盖识别、合成、实时对话到音频创作,相关服务价格也大幅下调。对需要批量转写或制作音频的用户来说,同样一笔预算能处理的量明显变多了。

据千问方面公布的信息,此次共推出五款模型:语音识别模型 Qwen-Audio-3.1-ASR、音频理解模型 ASR-Next、语音合成模型 TTS、音频创作模型 TTS-Next,以及实时语音交互模型 Realtime,构成覆盖理解、生成、交互与创作的音频能力链条。价格方面,TTS 降价约 70%,Realtime 降幅约 85%,ASR 降幅达 95%,官方称此举是为降低用户使用成本。

识别能力上,Qwen-Audio-3.1-ASR 支持 30 种语言和 16 种中文方言,新增原生转写润色能力,可自动去掉语气词与重复表达并重组语义。它采用端到端方案,把说话人标签、时间戳与文本联合输出,也能保留短插话和重叠语音。低延迟流式识别下,首字响应约 160 毫秒。官方评测数据显示,该模型在开源方言数据上的平均字错误率为 4.55%,在中文方言自建测试集上平均字错误率 10.38%。

合成与创作侧,Qwen-Audio-3.1-TTS 支持多语种及方言合成,并能在同一音色跨语言合成时保持自然迁移,用户可通过指令控制情绪、语速和表达方式。新发布的 TTS-Next 不再局限于单一语音合成,而是围绕文本、时间戳和参考音频,统一生成人声、音效与环境音,支持多人音色复刻与多轮对话生成,并支持 48kHz 输出,面向播客、有声书、影视剧、游戏等创作场景。

实时交互模型 Qwen-Audio-3.1-Realtime 采用全双工架构,说话与收听同时进行,用户可随时插话、打断;对话中切换语言时,模型会延续此前的上下文、语气和交流节奏。该模型可识别语气与交流意图,并能在实时对话中调用工具,连接 API、知识库和业务系统完成查询或任务执行。

落地方面,千问披露,Realtime 正在与 Qoder、千问办公等智能体,以及 QwenNote、A2、Eva、千问 AI 眼镜等智能硬件结合。在这些场景中,用户无需打开电脑或手机,可直接通过语音发起任务,并在持续对话中补充条件或了解执行进度。

信息来源:IT之家

免责声明:本站转载的文章,版权归原作者所有;旨在传递信息,不代表本站的观点和立场。

超聚变发布搭载AMD锐龙AI Max家族平台的FusionXpark M系列新品
上一篇 2026年9月23日 14:15
下一篇 2026年9月23日 16:44

相关推荐