登录

语音成为AI关键入口,阿里一口气把全栈模型能力都拿出来了


速读:海外AI语音输入工具Wispr半年估值翻近三倍逼近20亿美元,用户规模同比暴涨超百倍; 这也是为什么它同时面向个人用户和企业用户开放。
2026年08月07日 19:4

语音 AI 的竞争赛道正在转向。

作者|连冉

编辑|郑玄

我们正在悄然进入一个「打字越来越少」的时代。

过去,语音只是键盘输入的补充:开车时发消息、开会时记笔记,它是「不方便打字时的替代方案」;但现在,语音正在成为人机交互的核心入口之一—— 有人用语音写完一天的工作文档,有人靠语音驱动 AI 写完代码,甚至有产品从诞生起就没有打字框,全程靠说话完成所有操作。

这股「语音原生」的浪潮,也已经从用户习惯渗透到了一级市场。

海外 AI 语音输入工具 Wispr 半年估值翻近三倍逼近 20 亿美元,用户规模同比暴涨超百倍;从主打私密输入的 AI 语音戒指,到全场景语音交互助手,国内初创公司融资消息接连不断,2026 年第一季度全球语音 AI 赛道融资总额已超 70 亿美元。

当语音可以直接产出工作成果、触发完整业务流程的生产力入口,整个赛道的竞争逻辑也正在被改写。海外已经跑出了 ElevenLabs 这样估值超百亿美金的全链路语音平台,而国内市场还缺少一个真正意义上的语音生产力基建级产品。

8 月 7 日,阿里巴巴推出国内首个 AI 语音生产力平台 CosyVoice Studio,整合开放语音识别、语音合成、实时语音交互三类核心能力,覆盖「听、创、聊」全链路。

图片来源:Artificial Analysis 图片来源:Artificial Analysis CosyVoice Studio 背靠全球第一梯队的阿里自研 Qwen-Audio 语音大模型家族。比如,在全球第三方评测平台 Artificial Analysis 7月28日的榜单中,Qwen-Audio-3.0-Realtime 的综合指数(Speech to Speech Index)得分达 84.1%,摘得全球桂冠。语音推理、智能体表现和对话动态三个子项得分也均为世界第一。

有模型打底,再加上千问、钉钉、高德、淘天等真实业务场景的长期打磨,阿里正在尝试走出一条从模型能力到产品生态的语音商业化路径。这场从单点能力输出到全链路产品开放的升级,也为国内 AI 语音赛道的下一程,带来了全新的变量。

01

语音为什么正在成为下一代生产力的核心

大模型之前,语音其实是一个没什么存在感的模态。它能做的事很有限,更多是在辅助,帮用户把话转成文字,或者念一段合成语音给用户。

变化发生在最近一年。

在千问、豆包这些 AI 应用里,用户用语音对话的渗透率正在持续攀升,速度甚至超过了图像。语音从一条没人注意的「暗线」,变成了越来越清晰的「主线」。

大模型让语音变聪明了。以前语音只能「听见」和「念出来」,现在它能听懂你在说什么,能理解上下文,能做逻辑判断,能完成任务。语音从「输入输出方式」升级成了「能干活的东西」。

更直观的变化发生在 Vibe Coding 里。

年初这股风潮刮起来的时候,开发者的工作方式变了:不再埋头敲代码,而是不断对 AI 描述需求、调整方向、点头摇头。但很快他们撞上一个瓶颈——打字跟不上脑子转的速度。一分钟敲几十个字,远不及开口说话转文字的速度。

于是麦克风成了新的键盘。

大疆 DJI Mic Mini 被夹在领口,成了 Vibe Coding 的天然键盘;Typeless 把口述实时转成干净的文字喂给 AI,还顺手把废话删干净;Wispr 把语音输入做到了足够丝滑,它的深度用户里,72% 的日常输入都靠嘴完成。

不只是输入。录音硬件也在往同一个方向跑。

PLAUD 最早跑通了硬件+订阅的模式,把录音从保存声音推进到整理内容——硬件负责采集,App 负责转写,模板负责把不同场景里的话变成会议纪要、访谈摘要、播客素材。钉钉 A1 走得更远,按一下开始录制,录完不只是一段音频,而是转写、区分说话人、提炼重点、生成纪要、整理待办,一条链路走完。今年 618 它拿下天猫、抖音、京东三大平台 AI 录音设备销量第一,说明用户真的愿意为「说话即生产」买单。

图片来源:阿里 图片来源:阿里 事实上,声音只是这波浪潮里最显眼的一个入口。AI 眼镜把第一视角变成素材入口——钓鱼的人想记录大鱼上钩的瞬间,父母想一边带孩子一边拍成长片段,不用再停下来掏手机。AI 指环把睡眠、心率、压力变成可管理的数据,因为对一个高强度用 AI 的人来说,真正稀缺的不只是算力,还有自己的注意力。还有 Vibe Light 这类状态灯,让多 Agent 协作的进度一眼可见——红灯要授权,黄灯在运行,绿灯已完成。

这些硬件各自切入一个细分场景,但底层逻辑是一样的:现实世界的信息需要更低摩擦地进入 AI 的工作流。而声音,是门槛最低的那个入口。

海外市场已经在用钱投票。仅 2026 年第一季度,全球语音 AI 方向的融资总额就超过 70 亿美元。当语音从辅助功能走向生产系统,一站式平台的商业穿透力,已经被海外验证了。

但在国内,语音赛道还停留在单点工具的竞争阶段。做一场会议要找转写工具,做配音要找合成平台,做客服要对接语音接口——能力散点分布,个人和企业都有使用门槛。

当「说话」变成了「生产」,但生产链路被切碎成一个个孤岛,摩擦就出现了。用户现在需要的不只是一个更好的转写工具,或者一个更自然的合成声音,而是一条从采集到理解到产出的完整链路。

这就是为什么行业需要 CosyVoice Studio 这样一个聚合平台,一个覆盖「听、说、交互」全链路的语音生产力平台,它的出现也意味着国内 AI 语音从单点工具竞争,要走向平台级能力的竞争了。

02

从输入到创作再到交互

在 CosyVoice Studio 平台里,语音 AI 被拆成了三个不同方向:面向个人效率场景的 CosyFlow,面向内容生产和声音创作的 CosyCreative,以及面向企业服务智能体的 CosyAgent。它们分别对应了语音 AI 正在进入的三个方向:帮助人更高效地表达,让声音成为内容生产资料,以及让 AI 能够通过语音直接参与业务流程。

其中,最接近普通用户的,是 CosyFlow。

它的产品思路是:把语义理解融入到语音中,不再只是把一句话转换成文字,而是直接生成可以使用的工作结果。

过去使用语音输入,用户担心的问题其实不是「机器有没有听见」,而是「听完之后还需要改多少」。人在说话时会有大量非结构化表达:停顿、重复、临时改变想法,甚至说到一半推翻前面的内容。这些对于传统语音识别来说都是噪音,但对于大模型来说,恰恰是理解用户意图的一部分。

CosyFlow 做的事情,就是让 AI 处理掉这些表达过程中的「不完美」。

比如用户在通勤路上口述一段工作安排,过去可能只能得到一段未经整理的文字;现在 AI 可以理解其中的任务关系,去掉口语化表达,重新组织成一封正式邮件。又或者在一次访谈、会议之后,用户不需要再花时间整理录音,而是通过随记功能直接生成结构化内容,包括重点信息、讨论结论和后续待办。

这背后的变化是,语音输入正在从「记录工具」变成「内容生产工具」。

类似的变化,也发生在 CosyCreative 中。

过去,声音创作往往依赖专业设备、录音环境和后期制作。一段播客、一条宣传视频、一段有声内容,从脚本到成片,需要经历录音、剪辑、配音等多个环节。

而 AI 语音生成技术的发展,让声音开始像文字和图片一样成为一种可以被快速生产和编辑的内容资产。

在 CosyCreative 中,用户可以导入文稿或网页链接,选择合适的声音风格和音色,让 AI 完成配音和音频内容生成。对于企业而言,这意味着过去需要按天计算的内容制作周期,正在被压缩到分钟级。

视频来源:极客公园

笔者将今天的「极客早知道」文本输入在文本生成框里,简单设置之后, CosyCreative 便基于完整的早报内容生成了概括版本,然后进行了播报,整个过程大约只有一分钟,效率提高了好几倍。

这种能力并不只服务于内容创作者,也正在进入更多企业场景。例如车载助手、智能客服、数字人等应用,都需要稳定、一致且具备自然表达能力的声音。

而 CosyAgent 则进一步把语音从内容生产推向业务执行。

过去企业里的语音交互,更多集中在客服热线、智能导航等固定流程中。但随着大模型和 Agent 的发展,语音开始成为 AI 与用户完成复杂任务的一种方式。

一个语音 Agent 已经可以连接知识库、业务系统和工作流,理解用户需求后完成下一步操作。

对于企业来说,这意味着语音 AI 的价值不再只是降低人工客服成本,而是开始成为企业服务体系中的一个新入口。

从这三个方向可以看到,CosyVoice Studio 的核心并不是简单增加几个语音功能,而是试图覆盖语音 AI 从输入、生成到交互的完整链路。

这也是它与过去单点语音工具最大的区别。

过去,企业如果想使用语音能力,通常需要分别采购语音识别、语音合成、对话系统等不同模块,再通过技术团队完成集成。但对于很多企业来说,真正困难的并不是有没有模型,而是不知道模型如何进入具体业务。

CosyVoice Studio 的思路,是先把能力变成用户能够直接体验的产品,再让企业根据需求进一步接入。

这也是为什么它同时面向个人用户和企业用户开放。

个人用户通过官网降低体验门槛,让更多人能够感受到语音 AI 的变化;企业用户则可以从具体场景开始验证,再进入更深层的技术接入。

从这个角度看,CosyVoice Studio 更像是在模型能力和实际应用之间增加了一层产品化入口。

03

语音 AI 的竞争,最终拼的是场景和闭环

语音 AI 的竞争,看起来是模型能力的竞争。

但如果深入看,会发现真正决定模型上限的,并不只是参数规模,而是它经历过多少真实场景的训练和验证。

声音是一种高度依赖场景的数据。

会议里的多人讨论、开放空间中的远距离拾音、不同地区的方言表达、客服场景中的实时对话,这些复杂情况都不是单纯扩大模型规模就能解决的问题,而需要长期的数据积累和产品反馈。

而阿里的优势,恰好来自大量真实场景。

在生活娱乐场景中,千问 App 的语音对话入口,则沉淀了海量日常沟通、内容创作、信息查询等 C 端语音交互数据,覆盖了更丰富的口语表达与用户习惯。

在办公场景中,钉钉长期面对会议、沟通、协作等需求,需要解决复杂环境下的语音识别、会议记录和信息整理问题。钉钉智能语音输入背后的能力,本质上就是在真实办公流程中不断验证。

在出行场景中,高德需要面对大量导航语音、位置播报等需求,要求语音合成具备稳定性、自然度和实时响应能力。

在电商和客服场景中,语音交互则需要面对高并发、长链路和复杂业务问题,考验 AI 能否不仅听懂用户,还能完成服务任务。

主题:语音|阿里|输入