Hugging Faceの最新研究が11のオープンソース音声認識モデルをテストした結果、6つが参考答案の誤りをそのまま丸暗記して出力していた。スコアが高いモデルほど暗記の度合いが強く、未知の訛りに変えるとすぐに崩壊する。この研究は、ランキングのスコアが実性能を反映していない証拠を示した。
ランキングの「聴き取れる」、半分は「暗記済み」
VoxPopuliの一本の欧州議会演説、音声でははっきりと「Thank you, Mr. President」と発話されているのに、公式の参考答案には「Thank you」が入っていない。テストされた11のモデルのうち6つが、おとなしく欠けたバージョンをそのまま提出した——彼らは「聴いて」いたのではなく、答案を写していたのだ。
音声認識モデルの成績表を広げてみると、往々にして「人間レベル超え」「エラー率過去最低」といった言葉が並んでいる。これらのスコアの多くはVoxPopuliやLibriSpeechといった公開テストセットで計測されている。VoxPopuliは欧州議会の実際の講演録音を収集したもので、LibriSpeechは公開されているオーディオブック由来だ。Hugging Faceが2026年8月に発表した研究は、この「高スコア」の正体を暴き出した。研究チームは広く使われている11のオープンソースASR(自動音声認識)モデルをテストした結果、ランキング常連のいくつかが音声を「聴く」のではなく、参考答案を「暗記」していたことを発見した。
VoxPopuliの参考答案自体にも少なくない誤りが含まれており、Artificial Analysisが清澄版をわざわざ公開したこともある。研究チームは複数の低PER(音素エラー率)モデルで構成された「陪審団」を用いて検証した。PERとは書き起こされた文字と実際の発音がどれだけ近いかを示す指標で、低ければ低いほどモデルが音声に忠実であることを意味する。陪審団が一致して「参考答案が間違っている」と判断した場合にのみ、人間が再確認する。そして冒頭の一幕に遭遇した。音声には「Thank you」があるのに参考テキストにはそれがない。Cohere Transcribe、NVIDIA Canary-Qwen、IBM Granite-Speechなど6つのモデルが、誤った答案をそのまま書き写した。句読点まで一致している。誤った答案を写したモデルでは「Mr」がピリオドなしの「Mr」と書かれていた。元の参考答案がそのように書かれていたからだ。一方、音声に忠実に耳を傾けたモデルは、律儀に「Mr.」と書いていた。
研究チームが最も警戒したのは次の実験だった。同じ話者、同じ内容——ただし音声だけを変える。例えば、同じ議員の合成音声を用いたり、全モデルの学習カットオフ日以降に録音された新しい音声を使ったりして、この11モデルにもう一度走らせた。
先ほど誤った答案を写していたモデルの大半は、たちまち「正気」に戻り、律儀に「Thank you, Mr President」と書き出した。これは、モデルが言語法則に依拠していたのではなく、音響特徴から「これはVoxPopuliの問題だ」と嗅ぎ分けて、暗記済みの标准答案を引き出していたことを示している。研究チームはこの振る舞いを「ベンチマーク最適化」と呼び、界隈では「ベンチマックシング(刷分)」として俗称されている。
研究は2026年8月21日に発表され、Hugging FaceとHume AIの研究者によってGitHub上で同時に公開された。VoxPopuliとLibriSpeechが名指しで批判されているが、問題は「答案に誤りがある」ことだけに留まらない。これらのベンチマークは同時にモデルの学習とテストにも使われている。つまり試験前に問題が漏れていたのと同じで、高スコアになるのも当然だ。音声を変え、アクセントを変え、環境を変えれば、スコアは本性を見せます。Hugging FaceはOpen-ASR Leaderboardなどのランキングに「ホールドアウトセット」をわざわざ組み込んでいる。誰の目にも触れていない本物の録音を紛れ込ませ、モデルが本当に理解しているのか、それとも振る舞っているだけなのかを見極めるためだ。モデルたちが次にきれいな成績表を提出する前には、まずこの関門を突破しなければならない。
3つの手法で「答案暗記」を見抜く
モデルがスコアを水増ししているかどうか議論するより、実際にどれだけ水増ししているかを定量化したほうがいい。Hume AIの研究チームは3つのプローブ(探針)を使って、「ランキングの強者」と「本当に聴いている」モデルとを切り分けた。
第一の手法は「陪審団による逆検出」だ。研究チームは11の独立したASR(自動音声認識)モデルを選別し、音素エラー率(PER。モデルが書き出した文字と音声の近さを示す指標)で「最も耳が鋭い」モデルを抽出して陪審団を構成し、同じVoxPopuliの音声を同時に聞かせた。
VoxPopuliは欧州議会の録音から作られた公開データセットで、書き起こしの誤りが大量に含まれていることは業界内でも以前から指摘されていた(Artificial Analysisが清澄版を出したほどだ)。11モデルが一斉に参考答案と異なるバージョンを書き出したとき、研究者は参考答案自体が誤っていると判定した。なぜなら、11の独立したモデルの合意は、単一の参考答案よりも信頼に値するからだ。
第二の手法は「ミュート想起テスト」だ。音声内の特定の数字をミュートし、それでもモデルがその数字を書き出すかどうかを見る。書き出すなら、それは聴き取ったのではなく参考答案から暗記していたことになる。この手法は「単に聴力が良いだけ」という言い訳の余地を直接断つ。
第三の手法は「正書法切り替え定位」だ。正書法(orthography)とはスペル規範のことだ——「Mr」にピリオドを付けるかどうか、「colour」か「color」か、大文字小文字の習慣など。研究者はモデルがどの位置で、どのようなルールでスペルスタイルを切り替えるかを追跡した。切り替えポイントが音響特徴(アクセントの変化、語彙スタイルの変化)に対応していれば、モデルが聴いている証拠になる。切り替えポイントが参考答案のコーパス由来特徴に対応していれば、暗記していることになる。3つの手法を重ねれば、水増しモデルも逃れられない。
この方法群の優れた点は、「答えを知らない」という仮定に一切依存しないことだ。研究者は最初から最後まで、特定のモデルが不正行為を行ったかどうかを推測するのではなく、音声と参考答案の乖離度を定量化し、「モデルが聴いている」状態と「モデルが暗記している」状態を観測可能な行動から切り分けた。次に「人間レベル超え」という言葉を見かけたとき、ひとつ問いかけてみてほしい。テストされた音声はどの一批なのか?別の音声に置き換えても成立するのか?水増しされたスコアから水分をどう絞り込むのかは、次の節で解体して見せる。