阿里千问发布Qwen3.1系列语音大模型,并下调全线产品价格

IT之家 9 月 23 日消息,今天,千问正式发布 Qwen-Audio-3.1 系列语音大模型。本次升级不仅对语音识别、语音合成和实时语音交互三大核心模型进行了全面进化,更重磅推出了全新的音频创作模型 Qwen-Audio-3.1-TTS-Next 和音频理解模型 Qwen-Audio-3.1-ASR-Next。

官方称,五款全新的语音模型同时推出,形成了一套覆盖“理解-生成-交互-创作”的完整音频能力栈。为进一步降低用户使用成本,Qwen-Audio 全线语音模型价格均下调,其中 TTS 降价约 70%,Realtime 降幅约 85%,ASR 降幅达 95%。

IT之家附官方详细介绍如下:

Qwen-Audio-3.1-ASR:更强的上下文理解和润色

Qwen-Audio-3.1-ASR 是新一代语音识别大模型,进一步增强多语种、方言识别与上下文理解能力,并新增原生转写润色能力,可自动去除语气词与重复表达并重组语义,让转写的文字更顺畅、更有逻辑。

此外,全新方案的分角色转写,完整呈现“谁在什么时候说了什么”,为会议、访谈和对话分析提供可追溯的结构化记录。

核心能力亮点:

性能表现

开源方言 ASR / AST:

通过 KeSpeech 和 WSYue 的 11 个子集,评测模型在公开数据上的方言转写与翻译能力。Qwen-Audio-3.1-ASR 平均 CER 为 4.55%,并在 6 个子集上取得最优结果。

中文方言内部自建测试集 ASR:

评测模型对 16 种中文方言的原文转写能力,以字错误率(CER)衡量。Qwen-Audio-3.1-ASR 在 11 个方言子集上取得最优结果,平均 CER 为 10.38%,其中温州话等较难方言的提升尤为明显。

中文方言内部自建测试集 AST:

评测模型将方言语音翻译为普通话、准确保留原意的能力,以语义句准率衡量。

Qwen-Audio-3.1-ASR 在 11 个方言子集中的 10 个上表现最优,平均语义句准率达到 82.10%。

Qwen-Audio-3.1-ASR-Next:更好地理解人物情绪与场景

基于下代架构的音频理解模型 Qwen-Audio-3.1-ASR-Next 全新发布,它能够理解人物情绪、环境声与机械声,完成声音描述、事件定位、音频问答与推理。

例如,面对一段同时包含人物对话、背景音乐和环境声的音频,模型不仅可以输出对话文本,还可以进一步描述音频中包含哪些声音、相关事件在何时发生,并回答与整段内容有关的问题。

由此,ASR 处理的对象开始从“语音中的文字”扩展为“完整的音频信息”。

性能表现

分角色 ASR:

评测多人语音中“谁在什么时候说了什么”的识别能力,同时考察说话人区分和转写准确性。在四个测试集的八项指标中,
Qwen-Audio-3.1-ASR-Flash-Next
Qwen-Audio-3.1-ASR-Flash 版本分别取得五项和三项最优结果,均全面优于此前的 Fun-ASR 级联系统。

Qwen-Audio-3.1-TTS:更自然的跨语言音色合成

Qwen-Audio-3.1-TTS 是新一代语音合成大模型,支持多语种及方言合成,支持模型在同一音色跨语言合成时的自然迁移,让你秒讲数种语言。

相比只关注字音正确的传统方式,它更强调真实表达:通过指令控制情绪、语速和表达方式,让声音贴近具体内容与使用场景。

Qwen-Audio-3.1-TTS-Next:更高效的音频创作方式

基于下代架构的音频创作模型 Qwen-Audio-3.1-TTS-Next 全新发布。

过去,制作一段完整音频通常需要主播、音效师、混音师和剪辑师分工合作,分别制作人物对白、音效和背景声,再进行后期剪辑与合成。它不再局限于单一语音合成,而是围绕文本、时间戳和参考音频等输入,统一生成人声、音效和环境音,创作完整的音频内容。

核心能力亮点:

Qwen-Audio-3.1-Realtime:更自然的实时互动体验

实时语音交互,并不是把语音识别、语言模型和语音合成简单串起来。人与人的交流中,说与听常常同时发生:用户可能没说完就补充,也可能在对方回复时插话;同一句话,随情绪、关系和语气不同,含义也不同。

全新升级的 Qwen-Audio-3.1-Realtime 听得更懂,更会接话,更会共情,甚至可以主动调用 Agent 工具完成任务。全双工实时交互告别了过去模型只能听或只能说的现状,可以做到同时说和听,让用户可以随时插话、打断,交流体验更接近真人通话。

核心能力亮点:

基于多教师蒸馏架构,模型在保持低延迟的同时,提升了理解、推理、表达与安全能力,所解决的问题也从“如何实时回答用户”扩展为“如何在持续对话中理解变化的需求并完成任务”。

Qwen-Audio 进入 Agent 与智能硬件

Qwen-Audio-3.1-Realtime 正在与 Qoder、千问办公等 Agent,以及 QwenNote、A2、Eva、千问 AI 眼镜、乐奇 AI 眼镜等智能硬件结合。

在这些硬件场景中,用户不必始终打开电脑或手机,可以直接通过语音发起任务,并在实时对话中继续新增条件、修改需求或了解执行情况。

总结

Qwen-Audio 3.1 系列的升级,并不是对单一语音指标的局部优化,而是沿着五条明确的技术路径继续向前:

Qwen-Audio-3.1-ASR

新增了语音转写在多语种、方言识别与上下文理解能力,还支持原生转写润色能力。

Qwen-Audio-3.1-ASR-Next

将音频理解进一步扩展至泛音频理解,更好地理解人物情绪、环境声、机械声这些声音元素。

Qwen-Audio-3.1-TTS

让同一声色在跨语言合成时依然能保持自然感,让你秒讲数种语言。

Qwen-Audio-3.1-TTS-Next

从单一的人声合成扩展为通用音频生成系统,一次生成人声、音效与环境音共同构成的完整音频内容。

Qwen-Audio-3.1-Realtime

听得更懂,更会接话,更会共情,有更接近真人通话的交流体验,还能主动调用 Agent 工具完成任务。

能听懂、能创作、能聊天,Qwen-Audio 3.1 正在让语音成为连接人、内容与 AI 的自然入口。

展开阅读全文

更新时间:2026-09-24

标签:科技   阿里   产品价格   全线   语音   模型   系列   音频   方言   能力   声音   情绪   实时   语言   上下文

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号

Top