このモデルは、反応が非常に速いオペレーターのようなものです——あなたが話し終える前に、彼女は既に会話を引き継ぎ、さらに天気予報を調べたり、フードデリバリーを注文したりしてくれます。しかし、通話が2分を超えると、彼女は支離滅裂になり始めます。長く話していると、通話を切った後でも独り言を続け、あなたが言った単語をいくつか聞き逃すこともあります。もちろん、このオペレーターと少し会話するのは楽しいですが、彼女に直接あなたの仕事の電話を任せるには、もう少し待つ必要があるでしょう。たとえ話はここまでですが、実際の違いは:モデルの全二重通信とツール呼び出し能力は本物ですが、2分間のコンテキスト制限と多段階の会話での制御不能さは、これが現在のところ研究室に留まり、実運用環境で使用できないことを決定づけています。
イベント

448ミリ秒で聞きながら話し、割り込む——そしてどうなる?

2026年8月9日、NVIDIAはNemotronLabs VoiceChat 11Bを発表しました。リアルタイムの全二重通信とツール呼び出しをサポートするオープンソースの音声モデルで、会話遅延は448ミリ秒、ユーザー割り込みへの応答は480ミリ秒です。ただし、このモデルは現時点では研究用途限定——実運用環境には向きません。

まるで電話交換機のオペレーターのように、このモデルは話しながら同時に聞き、割り込まれれば即座に制御権を譲ります。混合Mamba/Transformerアーキテクチャを採用し、音声エンコーダー、LLM(自然言語を理解と生成が可能な人工知能モデル)、TTSデコーダーを一体化。さらにツール呼び出し専用のチャネルを備え、会話中に外部ツールを起動できます。

研究用途限定の理由は明確です。オーディオコンテキストの制限が2分間で、会話が複数回に及ぶと回復不可能な混乱が生じる可能性があるからです。

メカニズム

一つのネットワークで、どうやって同時に聞きながら話すのか

従来の音声会話が遅いのはなぜか、それをどう回避しているのか。

なぜ研究用途にのみなのか?まず、このモデルの答えは非常に直接的:従来の音声会話システムは、自動音声認識(ASR)、大規模言語モデル(LLM)、テキスト音声(TTS)の3つに分かれ、APIの受け渡し(モジュール間のデータ転送)とマルチモデルオーケストレーション(異なるモデル間の調整)で遅延が発生します。NemotronLabs VoiceChat 11Bは、これらを単一のネットワークに統合し、ストリーミング音声理解(連続した音声入力をリアルタイムで処理)とストリーミング音声生成(音声出力をリアルタイムで生成)を同時に行います。この設計は遅延を減らし、会話をスムーズにしますが、複雑なマルチタスクや長時間の会話では性能が落ちるため、現段階では研究限定です。

具体的には、このモデルは次のコンポーネントを使用しています:

1
高速Conformer音声エンコーダー
16 kHzの入力音声ストリームを継続的にエンコードします。
2
NVIDIA Nemotron Nano v2 LLMバックボーンネットワーク
オーディオトークン(モデルがテキストとオーディオを処理するための基本単位)を処理し、テキストトークンを予測します。
3
NVIDIA TTSデコーダーとコーデック
オーディオコードを予測し、22.05 kHzの代理音声にレンダリングします。

このモデルは、ツール呼び出しスクリプト用の専用出力チャネルも備え、API呼び出し(プログラム間のサービス要求操作)中も会話を継続します。

会話の一貫性を保つため、プレースホルダーメッセージ(ツール呼び出し中に再生される事前定義されたメッセージ)を導入し、ツール呼び出しがトリガーされると即座に再生して中断を防ぎます。

このアーキテクチャは単純な会話では非常にスムーズですが、マルチタスクが並列化されると利点が減少します。

NVIDIAは、オーディオコンテキストの時間制限、多段階の会話後の性能低下、会話終了後の独り言、ユーザーの書き起こしでの単語の欠落などの問題も明示しています。

方向性

よく話しはするが、それを実際のシステムに任せられるか?

NemotronLabs VoiceChat 11BはASR・LLM・TTSを単一ネットワークに統合した。多段階の会話では、モデルは独り言を話し、ユーザーの音声を書き起こす際に単語が欠落する。これらの問題は会話中に特に顕著であり、システムが制御不能になったり、ユーザーの指示が誤解されたりする可能性がある。

現時点では、研究室に留まるべきです。本番環境に導入するには、2分間のコンテキストと多段階の会話の制御不能という2つのハードルをまず解決する必要があります。

使えるからといって使えるとは限らない

48ミリ秒で優れた会話相手になるには十分ですが、2分間のコンテキストと多段階の制御不能問題が解決されるまでは、本番環境に導入するには本当の安全検証が必要です。

以下は、主な安全リスクと制限です:

  • コンテキストの制限:モデルは2分間のオーディオコンテキストしか処理できず、それを超えると性能が低下します。
  • 多段階の会話の問題:複数回の会話の後、モデルは回復不可能な混乱状態に陥り、無意味なコンテンツを生成する可能性があります。
  • 独り言:モデルは会話終了後にユーザーの参加を考慮せずに音声を生成し続ける可能性があります。
  • 単語の欠落:ユーザーの音声を書き起こす際に単語が欠落し、情報が不完全になる可能性があります。

NVIDIAチームは、このモデルのチェックポイントが「研究目的のみ」であることを明確にしており、本番環境での直接使用をさらに制限しています。それにもかかわらず、モデルのオープンな重みとライセンス契約は、研究者や開発者がその可能性を探索するための機会を提供しています。

ツール呼び出しは魅力的ですが、2つの厳しい制限があります——システムプロンプトとツール応答はASCII文字を使用する必要があり、ツール実行中にユーザーがモデルを中断することはできません。これらの制限は、モデルが技術的に突破したものの、実際の応用にはまだ慎重な評価が必要であることを示しています。

実践

どのようにしてNemotronLabs VoiceChat 11Bの能力を実際に体験するか

NemotronLabs VoiceChat 11Bのリリースにより、一般ユーザーや研究者がリアルタイムの全二重通信とツール呼び出しの実際の効果を間近で観察する機会が得られました。以下に具体的な操作上のアドバイスと注意事項を示します。

まず、適切なハードウェアのサポートがあることを確認する必要があります。NVIDIAは、このモデルを動作させるには少なくとも80GBのVRAM(GPU専用のメモリで、モデルパラメータや計算データを格納するために使用)を持つGPU、例えばA100、H100、RTX 6000 ProまたはB200が必要であり、オペレーティングシステムはx86_64 Linuxでなければならないと明確にしています。ほとんどの個人ユーザーはこのモデルを直接動作させることはできませんが、クラウドサービスプロバイダーを通じて必要なGPUリソースを借りることができます。

モデルの能力を検証するための具体的な手順
1

Hugging Faceのモデルページにアクセスし、モデルの重みと設定ファイルをダウンロードします。

2

ローカルまたはクラウド上でNVIDIA NeMoフレームワークを設定し、GPUリソースが利用可能であることを確認します。

3

モデルを起動し、リアルタイムの会話セッションを開始し、多段階の会話を行い、モデルの応答時間とスムーズさを観察します。

4

ツール機能を呼び出し、例えば天気予報や注文ステータスを問い合わせ、モデルがツール呼び出しを処理し、会話をスムーズに続ける様子を確認します。

5

モデルが話している間にそれを中断し、モデルがユーザーの割り込みを正しく処理して会話を続けることができるかどうかを確認します。

テストの過程で、いくつかの制限や潜在的な問題が発生する可能性があります。例えば、NVIDIAは、2分を超えるオーディオコンテキストを処理する際に性能が低下する可能性があり、会話が複数回行われると回復不可能な乱雑な出力が発生する可能性があることを指摘しています。モデルが会話終了後に独り言を話し始めることもあり、ユーザーの書き起こしでも単語の欠落が発生する可能性があります。これらの問題は研究環境では許容されますが、本番環境ではリスクをもたらす可能性があります。

私たちの判断は、NemotronLabs VoiceChat 11Bはリアルタイムの全二重通信とツール呼び出しにおいて強力な能力を示していますが、現段階では研究用途により適しており、商業的展開にはまだ適していないということです。NVIDIAがモデルをさらに最適化し、より完全なホスティングサービスを提供しない限り、ほとんどの企業はより成熟したバージョンを待つ必要があるかもしれません。

将来的には、NVIDIAはモデルの性能と安全性に関するさらなるアップデートを発表する可能性があります。私たちは公式の発表に注目し、コミュニティの議論に積極的に参加し、より多くの使用経験と改善の提案を得ることをお勧めします。

本記事はMarkTechPostの記事(2026/08/10)に基づいて執筆されました。メーカーが発表している数字(ベンチマークスコア、減少率など)はすべて公式なもので、第三者による独立した再測定は明記されていない限り行われていません。