8 月 4 日,腾讯混元发布了新一代语音识别模型 Hy ASR 3.0 preview。成绩单先摆出来:在开源评测集上,普通话词错率 3.34%、英语 2.62%、粤语 3.12%——三种语言全部压到 3% 左右。但这次真正的看点不是数字,而是它给出的解法:让大语言模型来管「听懂」这件事。
三语词错率全压到 3% 左右,还能听懂上下文
先说发布本身。Hy ASR 3.0 preview 是腾讯混元的新一代语音识别模型,官方给它的定位不是「转写得更准」,而是从「逐字转写、单点优化」演进到「理解语境、兼容场景、一键直出」。这句官话翻译成人话就是:它不再只是把声音换成字,而是先理解你说的这句话,再决定怎么落笔。
跑分层面(厂商口径):在开源评测集上,多语种词错率(WER,每 100 个词里认错几个,越低越好)整体控制在 3% 上下——普通话 3.34%、英语 2.62%、粤语 3.12%。在腾讯自建评测集上,通用识别、方言、上下文理解、专业词、高噪声和耳语场景的错词率也保持低位,综合评测集错词率最低。
对比图里还有个值得留意的细节:中文单项上,阿里 Qwen-audio-3.0-ASR Flash(3.13)其实略优于它(3.34),英语两者打平(同为 2.62)——官方说的「整体领先」是三语综合口径,不是每一项都第一。看厂商跑分,这种分寸要自己拿。
落地层面:模型已上线腾讯云提供 API(程序调用 AI 的入口)服务,面向智能客服、内容理解、语音搜索等场景;腾讯元宝深度参与共研并首发接入,长按说话就能免费体验方言识别、上下文纠错和复杂环境转写;WorkBuddy 等产品也在陆续接入。
把大语言模型装进语音识别,是这一代的共同路线
它是怎么做到「听懂」的?拆开架构看,有三块东西叠在一起。
第一块:大语言模型底座。Hy ASR 3.0 基于腾讯混元最新一代大语言模型 Hy3 的语言理解能力。传统语音识别是「声学模型」的独角戏——声音进来,逐帧匹配成字;现在多了一步「语义把关」:识别出的候选词,要过一遍语言模型的理解,结合上下文选出最合理的那个。你前面在聊网络设备,后面的「lùyóu」就会被写成「路由」而不是「旅游」。
第二块:MoEMoE 架构(把模型分成许多专家模块,每次只启用需要的那部分)架构与自研语音 Encoder。官方称其自研的无监督语音 Encoder(把声波压缩成模型能读懂的表示的编码器)用了数千万小时级语音数据训练,把「听」这一环的底子打厚。
第三块:多阶段强化学习(用奖惩信号反复训练,让模型自己试错变好)。在监督微调(在已训好的模型上做针对性再训练)之外再叠加多阶段强化学习,把识别策略往「真实场景好用」的方向拧。
「听清」已经卷到头了,真正的差距在「听懂」
如果你只看 3.34% 这个数字,可能没什么感觉——语音识别的错词率这些年一直在降,主流产品都已在个位数。那这次发布的意义在哪?
在于错的那 3% 错在哪。逐字硬转的识别器,错的往往正是最要命的地方:同音词选错(「期权」写成「弃权」)、专业词没听过(品牌名、人名、行业术语)、环境一吵就崩。这些错误靠声学模型继续堆数据是压不下去的——因为它们本质上不是「没听清」,而是「没理解」。
所以这一代的方向变了:把语言理解外包给大模型,让「听懂」来兜底「听不清」。官方列的四类能力升级全是这个思路——通用识别减少错字漏字、上下文同音词纠错、热词注入(提前把品牌名、人名、术语塞给模型重点照顾)增强专词识别、高噪与耳语场景专项优化。腾讯不是第一个这么做的——把 LLM 接进语音识别,是这一轮 ASR 升级的共同路线。
语音识别的竞争重心,正在从「声学做得多准」转向「语言理解接得多深」。错词率 3% 时代,谁能把剩下那 3% 里的同音词和专业词吃掉,谁的体验就断档领先。
免费首发押进元宝:语音是 AI 入口之争
再看腾讯的落地选择:Hy ASR 3.0 首发接入的不是某个企业客户,而是自家的元宝 App——方言识别、上下文纠错、复杂环境转写全部免费开放。这个动作值得咂摸一下。
语音输入是普通人每天接触 AI 最自然的入口:打字要学、要点、要盯屏幕,说话不用。谁家的语音输入更准、更懂你,谁就多占一分用户黏性。把最新一代识别能力免费放进自家助手,等于把「听得懂」当成获客功能来打。
另一头是生意:模型同步上线腾讯云 API,瞄准智能客服、内容理解、语音搜索这些付费场景。免费 C 端赚口碑、付费 B 端赚钱,两条腿走路。需要泼的冷水也在这里:目前发布的还是 preview 版,所有跑分均为厂商口径的评测集结果,第三方独立复测还没看到;「整体领先竞品」也需要等公开对比数据说话。
谁该现在就去试,谁该先等等
落到你我头上,分两种情况:
你是重度语音输入用户(微信语音转文字、口述记笔记):打开元宝长按说话,免费试这一代的上下文纠错和方言识别,对比一下你现在的输入法。
你做客服、会议纪要、语音搜索类产品:把腾讯云 Hy ASR 3.0 API 列入选型对比,重点测你自己的场景——专词、噪声、方言,别只看公开跑分。
你在意数据合规:API 意味着音频上云,评估前先看服务商的数据条款。
你想等确定性:目前是 preview 版,等正式版与第三方评测出来再决策也不迟。
语音识别的「听清」之争已经打到贴身距离,真正拉开差距的是「听懂」。接上 Hy3 大模型底座的 Hy ASR 3.0,把竞争焦点从声学推向了语言理解。重度语音输入用户值得去元宝免费试这一代的上下文纠错;做相关产品的,把 API 放进选型清单,用自己的真实场景说话。
本文事实来自腾讯混元官方发布稿,并经搜狐、新浪快科技、太平洋电脑网、PChome 等多家媒体报道交叉核对,数字一致。WER 跑分为厂商口径的开源评测集与自建评测集结果,尚未经第三方独立复测;体验结论请以你自己场景实测为准。