8 月 4 日,腾讯混元发布了新一代语音识别模型 Hy ASR 3.0 preview。成绩单先摆出来:在开源评测集上,普通话词错率 3.34%、英语 2.62%、粤语 3.12%——三种语言全部压到 3% 左右。但这次真正的看点不是数字,而是它给出的解法:让大语言模型来管「听懂」这件事

想象你雇了两个速记员。第一个逐字听写:你说「我们下周讨论产品的路由方案」,他老老实实写下「旅游方案」——每个字都听见了,意思对不对他不管。第二个是老练的秘书:她先听懂你在聊产品架构,再决定这个「lùyóu」该写成哪个词。Hy ASR 3.0 想做的,就是从第一个速记员变成第二个秘书。类比到此为止,实际差别是:秘书靠的是多年经验,它靠的是背后那个大语言模型。
事件

三语词错率全压到 3% 左右,还能听懂上下文

先说发布本身。Hy ASR 3.0 preview 是腾讯混元的新一代语音识别模型,官方给它的定位不是「转写得更准」,而是从「逐字转写、单点优化」演进到「理解语境、兼容场景、一键直出」。这句官话翻译成人话就是:它不再只是把声音换成字,而是先理解你说的这句话,再决定怎么落笔。

跑分层面(厂商口径):在开源评测集上,多语种词错率(WER,每 100 个词里认错几个,越低越好)整体控制在 3% 上下——普通话 3.34%、英语 2.62%、粤语 3.12%。在腾讯自建评测集上,通用识别、方言、上下文理解、专业词、高噪声和耳语场景的错词率也保持低位,综合评测集错词率最低。

开源评测集 WER 对比图:Hy ASR 3.0 preview 与 Doubao-Seed-ASR 2.0、Qwen 3 ASR、Qwen-audio-3.0-ASR Flash 在中英粤三语上的词错率对比
开源评测集 WER 对比(数值越低越准):中文单项 Qwen-audio-3.0-ASR Flash(3.13)略优于 Hy ASR 3.0(3.34),英语两项打平 · 来源:腾讯混元官方发布稿

对比图里还有个值得留意的细节:中文单项上,阿里 Qwen-audio-3.0-ASR Flash(3.13)其实略优于它(3.34),英语两者打平(同为 2.62)——官方说的「整体领先」是三语综合口径,不是每一项都第一。看厂商跑分,这种分寸要自己拿。

落地层面:模型已上线腾讯云提供 API(程序调用 AI 的入口)服务,面向智能客服、内容理解、语音搜索等场景;腾讯元宝深度参与共研并首发接入,长按说话就能免费体验方言识别、上下文纠错和复杂环境转写;WorkBuddy 等产品也在陆续接入。

3.34%
普通话词错率
开源评测集口径,每 100 个词约错 3.3 个。来源:腾讯混元官方发布稿。
2.62%
英语词错率
同一开源评测集口径,三语中最低。来源:腾讯混元官方发布稿。
数千万小时
语音训练数据
自研无监督语音 Encoder 的训练数据量级。来源:腾讯混元官方发布稿。
机制

把大语言模型装进语音识别,是这一代的共同路线

它是怎么做到「听懂」的?拆开架构看,有三块东西叠在一起。

第一块:大语言模型底座。Hy ASR 3.0 基于腾讯混元最新一代大语言模型 Hy3 的语言理解能力。传统语音识别是「声学模型」的独角戏——声音进来,逐帧匹配成字;现在多了一步「语义把关」:识别出的候选词,要过一遍语言模型的理解,结合上下文选出最合理的那个。你前面在聊网络设备,后面的「lùyóu」就会被写成「路由」而不是「旅游」。

第二块:MoEMoE 架构(把模型分成许多专家模块,每次只启用需要的那部分)架构与自研语音 Encoder。官方称其自研的无监督语音 Encoder(把声波压缩成模型能读懂的表示的编码器)用了数千万小时级语音数据训练,把「听」这一环的底子打厚。

第三块:多阶段强化学习(用奖惩信号反复训练,让模型自己试错变好)在监督微调(在已训好的模型上做针对性再训练)之外再叠加多阶段强化学习,把识别策略往「真实场景好用」的方向拧。

从「听写」到「听懂」的流水线
01
声波进
语音 Encoder 把声音压缩成表示
02
初转写
声学+语言联合给出候选词序列
03
语境把关
Hy3 底座结合上下文纠正同音词
04
直出结果
兼容方言、噪声、中英混说
关键变化在第 3 步:以前没有「理解」这一环,同音词只能靠统计硬猜。
反直觉

「听清」已经卷到头了,真正的差距在「听懂」

如果你只看 3.34% 这个数字,可能没什么感觉——语音识别的错词率这些年一直在降,主流产品都已在个位数。那这次发布的意义在哪?

在于错的那 3% 错在哪。逐字硬转的识别器,错的往往正是最要命的地方:同音词选错(「期权」写成「弃权」)、专业词没听过(品牌名、人名、行业术语)、环境一吵就崩。这些错误靠声学模型继续堆数据是压不下去的——因为它们本质上不是「没听清」,而是「没理解」。

所以这一代的方向变了:把语言理解外包给大模型,让「听懂」来兜底「听不清」。官方列的四类能力升级全是这个思路——通用识别减少错字漏字、上下文同音词纠错、热词注入(提前把品牌名、人名、术语塞给模型重点照顾)增强专词识别、高噪与耳语场景专项优化。腾讯不是第一个这么做的——把 LLM 接进语音识别,是这一轮 ASR 升级的共同路线。

一句话判断

语音识别的竞争重心,正在从「声学做得多准」转向「语言理解接得多深」。错词率 3% 时代,谁能把剩下那 3% 里的同音词和专业词吃掉,谁的体验就断档领先。

格局

免费首发押进元宝:语音是 AI 入口之争

再看腾讯的落地选择:Hy ASR 3.0 首发接入的不是某个企业客户,而是自家的元宝 App——方言识别、上下文纠错、复杂环境转写全部免费开放。这个动作值得咂摸一下。

语音输入是普通人每天接触 AI 最自然的入口:打字要学、要点、要盯屏幕,说话不用。谁家的语音输入更准、更懂你,谁就多占一分用户黏性。把最新一代识别能力免费放进自家助手,等于把「听得懂」当成获客功能来打。

另一头是生意:模型同步上线腾讯云 API,瞄准智能客服、内容理解、语音搜索这些付费场景。免费 C 端赚口碑、付费 B 端赚钱,两条腿走路。需要泼的冷水也在这里:目前发布的还是 preview 版,所有跑分均为厂商口径的评测集结果,第三方独立复测还没看到;「整体领先竞品」也需要等公开对比数据说话。

免费
元宝首发体验
长按说话体验方言识别、上下文纠错、复杂环境转写。来源:腾讯混元官方发布稿。
API
腾讯云开放服务
面向智能客服、内容理解、语音搜索等场景。来源:腾讯混元官方发布稿。
preview
当前版本状态
跑分为厂商口径,未见第三方独立复测。来源:综合官方与媒体报道。
动手

谁该现在就去试,谁该先等等

落到你我头上,分两种情况:

按需行动清单
1

你是重度语音输入用户(微信语音转文字、口述记笔记):打开元宝长按说话,免费试这一代的上下文纠错和方言识别,对比一下你现在的输入法。

2

你做客服、会议纪要、语音搜索类产品:把腾讯云 Hy ASR 3.0 API 列入选型对比,重点测你自己的场景——专词、噪声、方言,别只看公开跑分。

3

你在意数据合规:API 意味着音频上云,评估前先看服务商的数据条款。

4

你想等确定性:目前是 preview 版,等正式版与第三方评测出来再决策也不迟。

语音识别的「听清」之争已经打到贴身距离,真正拉开差距的是「听懂」。接上 Hy3 大模型底座的 Hy ASR 3.0,把竞争焦点从声学推向了语言理解。重度语音输入用户值得去元宝免费试这一代的上下文纠错;做相关产品的,把 API 放进选型清单,用自己的真实场景说话。

本文事实来自腾讯混元官方发布稿,并经搜狐、新浪快科技、太平洋电脑网、PChome 等多家媒体报道交叉核对,数字一致。WER 跑分为厂商口径的开源评测集与自建评测集结果,尚未经第三方独立复测;体验结论请以你自己场景实测为准。