登录

腾讯混元Hy ASR 3.0 preview发布:能理解上下文的语音识别登场


速读:腾讯混元HyASR3.0preview发布:能理解上下文的语音识别登场2026年08月04日16:49快科技快科技8月4日消息,今日,腾讯混元正式发布新一代语音识别模型HyASR3.0Preview,目前已上线腾讯云官网并对外提供API服务,可应用于智能客服、内容理解、语音搜索等场景。 今日, 腾讯混元正式发布新一代语音识别模型Hy ASR 3.0 Preview,目前已上线腾讯云官网并对外提供API服务。
2026年08月04日 16:49

快科技8月4日消息,今日, 腾讯混元正式发布新一代语音识别模型Hy ASR 3.0 Preview,目前已上线腾讯云官网并对外提供API服务,可应用于智能客服、内容理解、语音搜索等场景。

腾讯元宝深度参与模型共研,并已完成首发接入,用户打开元宝长按说话,即可体验方言识别、上下文智能纠错以及复杂环境稳定转写等能力,相关功能免费开放。

与此同时,WorkBuddy等腾讯产品也在陆续接入。

据腾讯介绍, Hy ASR 3.0 Preview基于新一代大语言模型Hy3的语言理解能力,将高精度语音识别与深度语义理解相结合,在通用识别、上下文感知、复杂场景稳定性和方言覆盖等方面实现升级。

评测数据显示,在开源测试集中,Hy ASR 3.0 Preview的多语种词错误率均控制在3%左右。

其中,中文普通话WER为3.34%,英语WER为2.62%,粤语WER为3.12%。

在自建评测集中,该模型在通用语音、方言、上下文理解、专业词汇以及高噪声、耳语等复杂声学场景中,也保持了较低的词错误率。

从实际使用体验来看,Hy ASR 3.0 Preview重点提升了四项能力。

首先是通用识别准确率进一步提升,可覆盖普通话、方言以及中英文混说等场景,减少错字、漏字和长音频识别偏差。

其次, 模型支持结合Context上下文理解用户语境,可对同音词进行智能纠错,降低因上下文缺失导致的语义误判。

针对专业场景,Hy ASR 3.0 Preview支持热词注入增强,可快速识别品牌名称、产品名称、人名和行业术语,减少企业在模型适配和词库维护方面的成本。

此外,腾讯还针对高噪声、耳语和低声说话等场景进行了专项优化,使模型在复杂环境下仍能保持较为稳定的转写效果。

技术层面,Hy ASR 3.0 Preview采用兼顾效率和性能的MoE架构,并将基座模型升级至Hy3,进一步增强语言理解、上下文建模和语义推理能力。

语音侧则采用腾讯自研的无监督语音Encoder,通过数千万小时无监督语音数据进行训练,从复杂音频中提取高质量声学特征。

为进一步提升语音建模和理解能力,混元团队还对语音Encoder与大语言模型进行联合训练,引入数千万小时、多来源语音数据,覆盖多种方言、口音和声学环境,并通过高质量数据管线完成精细化标注。

主题:模型|腾讯|HyASR3.0Preview