Hugging Face 最新研究测了 11 个开源语音识别模型,发现 6 个会把参考答案里的错误一字不差地背出来——音频里明明说了“Thank you”,交出的转写却漏掉。跑分越高,背得越起劲;换一副陌生口音,当场翻车。

这就像一场开卷考试:考生们面前摆着历年真题和「标准答案」,平时模拟考个个满分。但真到了现场口试,考官换了一个从没听过的地方口音、把某句话换了个说法,平时最会抄答案的学霸反而最先卡壳——因为他们练的是「背」,不是「听」。类比到此为止,实际差别是:背错了参考答案只是扣分,而 AI 把错误的转写当成「正确答案」输出,影响的是后续所有依赖这段文字的下游系统——搜索、字幕、客服、听写、医疗记录,一个错字可能跟着错一路。
事件

榜单上的「听懂」,有一半是「背熟」

VoxPopuli 的一段欧盟议会演讲,音频里清清楚楚说了「Thank you, Mr. President」,但官方参考答案里没有「Thank you」。11 个被测模型里有 6 个乖乖交出了漏字的版本——它们不是在「听」,是在抄卷子。

把语音识别模型的成绩单摊开看,往往是「超越人类水平」「错误率新低」一类的字眼。这些分数大多跑在 VoxPopuli、LibriSpeech 这几个公开测试集上,VoxPopuli 收集的是欧洲议会的真实演讲录音,LibriSpeech 来自公开的有声书。Hugging Face 在 2026 年 8 月发布的一项研究,直接把这种「高分」扒了个底朝天:研究团队测了 11 个被广泛使用的开源 ASR(自动语音识别)模型,结果发现好几个榜单常客并没有在认真「听」音频,而是在背参考答案。

VoxPopuli 的参考答案本身有不少错误,Artificial Analysis 曾专门发布过清洗版。研究团队用一个由多个低 PER(音素错误率)模型组成的「评审团」来挑刺——PER 衡量的是写出来的文字和实际发音有多接近,越低说明模型越忠于音频。当评审团一致认为「参考答案错了」时,再人工核对。然后就碰到了开头那一幕:音频里有「Thank you」,参考文本里没有,Cohere Transcribe、NVIDIA Canary-Qwen、IBM Granite-Speech 等六个模型全都照着错答案抄。连标点都对齐了:抄错答案的模型把「Mr」写成没句号的「Mr」,因为原参考答案就这么写的;老老实实听音频的模型则规规矩矩写成「Mr.」。

最让研究团队警觉的是下一个实验。同一个说话人、同样的内容,只是换了一种声音——比如用同一位议员的合成语音,或者用一段在所有模型训练截止日期之后录下的新音频,再让这 11 个模型跑一遍。

多数之前抄错答案的模型立刻「清醒」过来,老老实实打出「Thank you, Mr President」。这说明模型靠的不是语言规律,而是从声学特征里嗅出了「这道题来自 VoxPopuli」的气息,然后调出背好的标准答案。研究团队把这种行为叫做「基准测试优化」,圈内俗称「刷分」(benchmaxxing)。

40%
VoxPopuli 测试集被怀疑存在参考答案错误的样本比例
来源:Hugging Face Blog
约 3%
受影响参考词占全部词的比例
来源:Hugging Face Blog
18%–30%
表现出「背答案」行为的模型复刻错误转写的频率
来源:Hugging Face Blog
11 个
研究测试的开源 ASR 模型数量
来源:Hugging Face Blog

研究发布于 2026 年 8 月 21 日,由 Hugging Face 与 Hume AI 的研究人员在 GitHub 上同步公开。VoxPopuli 和 LibriSpeech 被点名,问题不止于「答案有错」——这些基准同时被用来训练和测试模型,等于考前漏题,跑分自然好看;音频一换、换一种口音、换一种环境,分数就会露出原形。Hugging Face 在 Open-ASR Leaderboard 等榜单中专门加入了「留出集」,就是要把没被任何人见过的真实录音混进去,看模型到底是真懂还是装懂。模型们下次再交出漂亮成绩单之前,得先过这一关。

为何要紧

三招测出谁在背答案

与其争论模型在刷分,不如直接量化它刷了多少。Hume AI 的研究团队用三个探针,把"榜单强者"和"真正在听"的模型切开。

第一招叫"陪审团反向检测"。他们挑了 11 个独立的 ASR(自动语音识别)模型,按音素错误率(PER,即模型写出的文字和音频里声音的接近程度)筛出一批"耳朵最灵"的组成陪审团,让它们同时听同一段 VoxPopuli 音频。

VoxPopuli 是欧洲议会录音攒出来的公开数据集,早被业内指出转写错误一大堆(连 Artificial Analysis 都出过清洗版)。当 11 个模型集体写出和参考答案不同的版本,研究者就判定参考答案本身写错了——因为 11 个独立模型的共识比单条参考答案更值得信。

第二招叫"静音召回"。把音频里某个数字静音掉,看模型还会不会写出那个数字。会的话,它不是听出来的,是从参考答案背下来的。这一招直接掐掉了"它只是听力好"的辩解空间。

第三招叫"正字法切换定位"。正字法(orthography)就是拼写规范——"Mr"带不带点、"colour"还是"color"、大小写习惯。研究者追踪模型在什么位置、按什么规则切换拼写风格:如果切换点对的是声学特征(口音变了、用词风格变了),说明模型在听;如果切换点对的是参考答案的语料来源特征,那就是在背。三招叠加,刷分模型无处遁形。

这套方法的厉害之处在于:它不依赖任何"我不知道答案"的假设。研究者从头到尾没去猜某个模型有没有作弊,只是把音频和参考答案的偏离度量化出来,把"模型在听"和"模型在背"从可观察的行为里拆开。下次再看到"超越人类水平"——可以多问一句:测的是哪批音频?换一批还成立吗?至于刷出来的分要怎么挤掉水分,下一节拆给你看。