8月4日、テンセントの混元(Hy 元)は次世代音声認識モデルHy ASR 3.0 previewをリリースしました。まず結果からお伝えします:オープンソースの評価セットにおいて、普通話の単語誤り率(WERR)は3.34%、英語は2.62%、広東語は3.12%と、三言語すべてが3%前後となりました。しかし今回の本当の注目点は数字ではなく、そのアプローチにあります:大規模言語モデルに「理解」を任せるというものです。
三言語の単語誤り率がすべて3%前後に、コンテキストも理解可能に
まずはリリース内容について。Hy ASR 3.0 previewはテンセントの混元の次世代音声認識モデルであり、公式には「より正確に書き起こす」のではなく、「一字一句の書き起こし、単一ポイントの最適化」から「コンテキストの理解、シーンの互換性、一発での出力」に進化したと位置づけられています。この公式の説明を平たく言うと:もはや音を文字に変換するだけでなく、まずあなたが言ったことを理解し、それからどのように書き留めるかを決めるということです。
性能面では(メーカーの説明による):オープンソースの評価セットにおいて、多言語の単語誤り率(WER、100単語中何単語認識を誤ったか、低ければ低いほど良い)は全体で3%前後——普通話は3.34%、英語は2.62%、広東語は3.12%となっています。テンセント自社構築の評価セットでは、汎用認識、方言、コンテキストの理解、専門用語、ノイズの多い環境やささやき声のシーンでの誤り率も低く抑えられており、総合的な評価セットでの誤り率は最も低くなっています。
公式の比較グラフには注目すべき細部がある。中国語単体ではアリババの Qwen-audio-3.0-ASR Flash(3.13)が実際わずかに上回り(3.34)、英語は両者とも 2.62 で同点——公式の「全体でリード」は三言語総合の口径であり、全項目で一位という意味ではない。メーカーのベンチマークを読む際は、こうした分寸を自分で持つ必要がある。
実際の適用面では:このモデルはすでにテンセントクラウドでAPI(プログラムがAIを呼び出す入り口)サービスとして提供されており、スマートカスタマーサービス、コンテンツ理解、音声検索などのシーンを対象としています。テンセントの元宝(Diamond)アプリが深く共同開発に参加し、初の採用モデルとして、長押しして話すだけで方言認識、コンテキストの訂正、ノイズの多い環境での書き起こしを無料で体験できます。WorkBuddyなどの製品も順次採用を進めています。
音声認識に大規模言語モデルを搭載するのは、今世代の共通路線
どのように「理解」しているのか?その構造を分解すると、三つの要素が重なっています。
第一の要素:大規模言語モデル基盤。Hy ASR 3.0はテンセント混元の最新世代の大規模言語モデルHy3の言語理解能力に基づいています。従来の音声認識は「音響モデル」の独壇場でした——音が入力され、フレームごとに文字にマッチングされます。しかし今は「意味のチェック」というステップが追加されました:認識された候補単語は、言語モデルによる理解を経て、文脈に基づいて最も適切なものが選ばれます。あなたがネットワーク機器について話している場合、後続の「lùyóu」は「路由」としてではなく「旅游」として書き起こされることはありません。
第二の要素:MoEMoEアーキテクチャ(モデルを多くの専門家モジュールに分割し、必要な部分だけを有効にする)アーキテクチャと自社開発の音声エンコーダー。公式には自社開発の教師なし音声エンコーダー(音波をモデルが理解できる表現に圧縮するエンコーダー)は数千万時間級の音声データでトレーニングされ、「聞く」という部分の基盤を厚くしたと述べています。
第三の要素:多段階強化学習(報酬と罰のシグナルを使って繰り返しトレーニングし、モデルが自ら試錯して改善する)。教師付き微調整(学習済みモデルに対してさらに狙いを定めた再学習を行うこと)に加えて多段階強化学習を重ねることで、認識戦略を「実際のシーンで使いやすい」方向に調整します。
「聞き取り」はすでに限界に達しており、本当の違いは「理解」にある
もし3.34%という数字だけを見ると、それほど印象に残らないかもしれません——音声認識の単語誤り率はここ数年で着実に減少し、主流製品はすでに一桁台になっています。では今回のリリースの意義はどこにあるのでしょうか?
それは誤りの3%がどこで起こっているかということです。一字一句硬く書き取る認識器は、最も重要な場所で誤りを犯しがちです:同音異義語の選択ミス(「棄権」を「棄権」と書き間違える)、専門用語を知らない(ブランド名、人名、業界用語)、騒がしい環境で崩れる。これらの誤りは音響モデルがさらにデータを積み重ねても減らすことはできません——なぜならそれらは本質的に「聞き取れなかった」のではなく、「理解できなかった」からです。
ですから、今世代の方向性は変わりました:言語理解を大規模モデルにアウトソーシングし、「理解」で「聞き取れない」を補う。公式が挙げた4つの能力向上はすべてこの考え方に沿っています——汎用認識での誤字脱字の減少、文脈での同音異義語の訂正、ホットワード注入(事前にブランド名、人名、用語をモデルに重点的に覚え込ませる)による専門用語認識の強化、ノイズの多い環境とささやき声のシーンへの特別な最適化。テンセントが最初にやったわけではありません——LLMを音声認識に組み込むことは、今度のASRアップグレードの共通路線です。
音声認識の競争の焦点は、「音響的にどれだけ正確か」から「言語理解をどれだけ深く組み込んでいるか」にシフトしています。単語誤り率3%時代において、残りの3%の中の同音異義語や専門用語をどれだけ処理できるかが、体験の断トツの優位性を決めるのです。
無料で元宝に初搭載:音声はAI入口の争い
テンセントの適用選択を見ると:Hy ASR 3.0が初搭載されたのは特定の企業顧客ではなく、自社の元宝アプリでした——方言認識、文脈訂正、ノイズの多い環境での書き起こしがすべて無料で開放されています。この動きは少し考えてみる価値があります。
音声入力は一般の人が毎日AIに触れる最も自然な入口です:タイピングは学び、クリックし、画面を見つめる必要がありますが、話すのは不要です。音声入力がより正確で、よりあなたを理解してくれるなら、それだけユーザーの粘着性も高まります。最先端の認識能力を無料で自社のアシスタントに搭載することは、「理解できる」を集客機能として打ち出すことです。
もう一つの側面はビジネスです:モデルは同時にテンセントクラウドAPIで提供され、スマートカスタマーサービス、コンテンツ理解、音声検索といった有料シーンを対象としています。無料のC端で評判を得て、有料のB端で稼ぐ、二本足の歩き方です。ここに冷や水を浴びせるべき点もここにあります:現時点ではpreview版がリリースされているだけで、すべてのスコアはメーカーの説明による評価セットの結果であり、第三者による独立した再テストはまだありません。「総合的に競合製品より優れている」についても、公開比較データが出てから判断する必要があります。
今試すべきか待つべきか
具体的な行動としては、二つの状況が考えられます:
あなたがヘビーな音声入力ユーザー(WeChatの音声からテキストへの変換、口述メモ):元宝を開いて長押しして話し、この世代の文脈訂正や方言認識を試してみてください。そして現在の入力方法と比べてみてください。
あなたがカスタマーサービス、議事録、音声検索関連の製品を作っている:テンセントクラウドHy ASR 3.0 APIを選定リストの候補に入れ、自分の実際のシーンで重点的にテストしてください——専門用語、ノイズ、方言など、公表されているスコアだけを見てはいけません。
あなたがデータコンプライアンスを気にしている:APIは音声がクラウドに上がることを意味しますので、サービスプロバイダーのデータ規約を評価する前に確認してください。
あなたが確定性を待っている:現時点ではpreview版なので、正式版と第三者による評価が出てから判断しても遅くはありません。
音声認識の「聞き取り」競争はすでに密接な距離に達しており、本当に差をつけるのは「理解」です。Hy3大規模モデル基盤を搭載したHy ASR 3.0は、競争の焦点を音響から言語理解へと移しました。ヘビーな音声入力ユーザーは元宝アプリでこの世代の文脈訂正を無料で試す価値があります。関連する製品を作っている方は、APIを選定リストに入れ、自分の実際のシーンでテストしてください。
本記事の事実はテンセント混元の公式プレスリリースに基づいており、ソウシア、新浪快科技、パシフィックコンピューターネットワーク、PChomeなど複数のメディアの報道とクロスチェックを行い、数字の一致を確認しています。WERスコアはメーカーの説明によるオープンソースの評価セットと自社構築の評価セットの結果であり、第三者による独立した再テストはまだ行われていません。体験に関する結論は、実際のシーンでのテストに基づいてください。