首页 / 资讯详情
语音成为 AI 关键入口,阿里一口气把全栈模型能力都拿出来了
摘要
作者|连冉 编辑|郑玄 我们正在悄然进入一个「打字越来越少」的时代。 过去,语音只是键盘输入的补充:开车时发消息、开会时记笔记,它是「不方便打字时的替代方案」;但现在,语音正在成为人机交互的核心入口之一—— 有人用语音写完一天的工作文档,有人靠语音驱动 AI 写完代码,甚至有产品从诞生起就没有打字框,全程靠说话完成所有操作。 这股「语音原生」的浪潮,也已经从用户习惯渗透到了一级市场。 海外 AI 语音输入工具 Wispr 半年估值翻近三倍逼近 20 亿美元,用户规模同比暴涨超百倍;从主打私密输入的 AI 语音戒指,到全场景语音交互助手,国内初创公司融资消息接连不断,2026 年第一季度全球语音 AI 赛道融资总额已超 70 亿美元。 当语音可以直接产出工作成果、触发完整业务流程的生产力入口,整个赛道的竞争逻辑也正在被改写。海外已经跑出了 ElevenLabs 这样估值超百亿美金的全链路语音平台,而国内市场还缺少一个真正意义上的语音生产力基建级产品。 8 月 7 日,阿里巴巴推出国内首个 AI 语音生产力平台 CosyVoice Studio,整合开放语音识别、语音合成、实时语音交互三类核心能力,覆盖「听、创、聊」全链路。 图片来源:Artificial Analysis CosyVoice Studio 背靠全球第一梯队的阿里自研 Qwen-Audio 语音大模型家族。比如,在全球第三方评测平台 Artificial Analysis 7月28日的榜单中,Qwen-Audio-3.0-Realtime 的综合指数(Speech to Speech Index)得分达 84.1%,摘得全球桂冠。语音推理、智能体表现和对话动态三个子项得分也均为世界第一。 有模型打底,再加上千问、钉钉、高德、淘天等真实业务场景的长期打磨,阿里正在尝试走出一条从模型能力到产品生态的语音商业化路径。这场从单点能力输出到全链路产品开放的升级,也为国内 AI 语音赛道的下一程,带来了全新的变量。 01 语音为什么正在成为下一代生产力的核心 大模型之前,语音其实是一个没什么存在感的模态。它能做的事很有限,更多是在辅助,帮用户把话转成文字,或者念一段合成语音给用户。 变化发生在最近一年。 在千问、豆包这些 AI 应用里,用户用语音对话的渗透率正在持续攀升,速度甚至超过了图像。语音从一条没人注意的「暗线」,变成了越来越清晰的「主线」。 大模型让语音变聪明了。以前语音只能「听见」和「念出来」,现在它能听懂你在说什么,能理解上下文,能做逻辑判断,能完成任务。语音从「输入输出方式」升级成了「能干活的东西」。 更直观的变化发生在 Vibe Coding 里。 年初这股风潮刮起来的时候,开发者的工作方式变了:不再埋头敲代码,而是不断对 AI 描述需求、调整方向、点头摇头。但很快他们撞上一个瓶颈——打字跟不上脑子转的速度。一分钟敲几十个字,远不及开口说话转文字的速度。 于是麦克风成了新的键盘。 大疆 DJI Mic Mini 被夹在领口,成了 Vibe Coding 的天然键盘;Typeless 把口述实时转成干净的文字喂给 AI,还顺手把废话删干净;Wispr 把语音输入做到了足够丝滑,它的深度用户里,72% 的日常输入都靠嘴完成。 不只是输入。录音硬件也在往同一个方向跑。 PLAUD 最早跑通了硬件+订阅的模式,把录音从保存声音推进到整理内容——硬件负责采集,App 负责转写,模板负责