登录

千问发布Qwen-Audio-3.1系列语音大模型,五款模型全线降价最高95%


速读:千问大模型9月23日发布 Qwen-Audio-3.1系列语音大模型。
2026-09-23 15:28

千问大模型9月23日发布 Qwen-Audio-3.1系列语音大模型,形成覆盖理解、生成、交互与创作的完整音频能力栈。系列包含语音识别 Qwen-Audio-3.1-ASR、音频理解 ASR-Next、语音合成 TTS、音频创作 TTS-Next 与实时交互 Realtime,API 已上架千问 AI 平台,ASR-Next API 即将上线。同期全线降价,TTS 降幅约70%,Realtime 约85%,ASR 达95%。

QQ20260923-152735.jpg

能力层面,ASR 增强多语种、方言识别与上下文理解,新增原生转写润色,可自动去除语气词与重复表达,并支持端到端分角色转写,联合输出说话人标签、时间戳与文本;一套模型支持30种语言和16种中文方言,流式识别首字响应约160毫秒。

ASR-Next 基于下代架构,把音频理解从语音中的文字扩展至情绪、环境声与机械声,支持声音描述、事件定位与音频问答推理。TTS 支持同音色跨语言自然迁移,并以指令控制情绪与语速。TTS-Next 面向音频创作,统一生成人声、音效与环境音,支持多角色音色复刻、细粒度时间戳与48kHz 输出,服务播客、有声书与影视游戏场景。Realtime 基于多教师蒸馏架构实现全双工交互,可随时插话打断,支持多语言实时切换、情绪理解与对话中调用工具。

实测方面,ASR 在开源方言测试集平均 CER4.55%,中文方言自建集平均 CER10.38%,方言转普通话平均语义句准率82.10%;ASR-Flash-Next 与 ASR-Flash 在四测试集八项指标中分获五项、三项 最优 ,全面优于此前的 Fun-ASR 级联系统。

目前 Realtime 正与 Qoder、千问办公等 Agent 及千问 AI 眼镜等智能硬件结合,延续语音成为人机交互自然入口的趋势。

Qwen-Audio-3.1-ASR:

https://www.qianwenai.com/models/qwen-audio-3.1-asr-flash

Qwen-Audio-3.1-TTS:

https://www.qianwenai.com/models/qwen-audio-3.1-tts-flash

Qwen-Audio-3.1-TTS-Next:

https://www.qianwenai.com/models/qwen-audio-3.1-tts-next

Qwen-Audio-3.1-Realtime:

https://www.qianwenai.com/models/qwen-audio-3.1-realtime-plus

(Qwen-Audio-3.1-ASR-Next API即将上线)

主题:千问