8月5日、バイトダンスのSeedがネイティブ音声・映像の全二重(同時に聞くことと話すことができる双方向チャンネルで、トランシーバーのように交互に話す必要がない)大モデルSeedRealtimeを発表しました。これは音声、映像映像、テキストを統合した単一のフレームワークで、連続した映像と音声の流れの中でリアルタイムにインタラクションを行うというもの——公式には「見ながら、聞きながら、話す」と定義されています。しかもこれは単なる紙上の発表ではなく、すでに豆包アプリにフル実装されています。アプリのチャットボックスで「通話」を選択し、動画通話に入ると体験できます。

2つのコミュニケーション方法を想像してみてください。1つはトランシーバーです。あなたが話し終わったらボタンを離し、相手が話せるようになる——一進一退、交互に話す方法です。もう1つは対面での会話です。相手はあなたの身振り手振りを見ながら、あなたの話を聞き、あなたが詰まれば助け舟を出したり、あなたが夢中で話していれば静かに聞いていたりします。今日のほとんどのAI音声アシスタントはまだトランシーバーの段階にあります。SeedRealtimeが目指しているのは後者——しかもそれは目を持っています。たとえここまでにして、実際の違いは:対面での会話では常識でいつ話すべきかを判断しますが、SeedRealtimeは連続した音声・映像の流れの中でエンドツーエンドのモデルが継続的に判断するということです。
出来事

3つのコアな技術的突破、豆包にフル実装

公式発表資料によると、SeedRealtimeの能力は3つのコアな技術的突破に分類され、それぞれが「リアルタイムインタラクション」の長年の課題を指しています。

第一に、音声と映像の統合理解です。音声、映像、時系列情報が深く融合されています。同音異義語に出会った場合、現在の映像と組み合わせて曖昧さを解消します。「これどうするの?」と言うと、手の動き、視線、映像に基づいて「これ」が何を指しているのかを判断します。

第二に、能動的なインタラクションです。受動的に質問されるのを待つのではなく、画面内の重要な対象が現れたとき(例えば「あの展示品を見かけたら教えて」と頼んだ場合)、能動的に話しかけます。さらに、ツールを呼び出して調べた情報を回答に組み込むこともできます。

第三に、リズムのコントロールです。リアルタイムであなたの対話状態を感知し、適切なタイミングで自然に会話を続けたり、黙るべきときには邪魔をしないようにします。さらに重要なのは耐干渉性です——他の人の雑談や背景ノイズを区別し、無関係な音声に誤って反応しないようにします。

−50%
対話リズム問題の減少
エンドツーエンドの人的評価基準で、カスケードモデルと比較して、割り込み、遅延、誤作動などのつまずきが半減しました。出典:バイトダンスSeed公式発表資料。
7個
実際のシーンでの事例
食事会での人物認識、四川料理店の翻訳、博物館でのリマインダー、コーヒーマシンのエラー訂正、論文のページめくり停止、空港での道案内、学習支援と耐干渉性。出典:バイトダンスSeed公式発表資料。
フル実装
豆包への実装範囲
チャットボックスの「通話」を選択し動画通話に入ると体験可能で、公式には業界初の規模での実装と称されています。出典:バイトダンスSeed公式発表資料。
仕組み

なぜ「見ながら、聞きながら、話す」のが難しいのか

今回の発表の重要性を理解するために、まずはそれ以前の2つのアプローチがどこでつまずいていたのかを見てみましょう。

最初の道:カスケードシステム(タスクを複数のモジュールに分割してリレー方式で処理:まず聞いて、次に映像を見て、最後に話す)音声はまずASR(自動音声認識、音声をテキストに変換する)によってテキストに変換され、次に視覚言語モデルによって理解され、最後にTTS(テキスト音声合成、テキストを音声に戻す)によって話されます——モジュールが直列に接続されているため、遅延が蓄積され、情報も段階的に失われます。

2番目の道:エンドツーエンドモデル(1つのモデルが直接入力から出力まで処理し、モジュールを分割してリレーしない)よりスムーズですが、公式には多くのソリューションはまだ外付けのVAD(音声アクティビティ検出、外部ルールで話し終わったかどうかを判断する)に依存してターンを判断していると指摘しています——本質的には一问一答の半二重(同時に一方しか話せないチャンネル)です。

SeedRealtimeの解決策は、音、映像、時系列と表現を同じエンドツーエンドモデルに統合することです。先に聞いて、次に映像を見て、最後に答えるのではなく、感知、理解、決定、表現が同時に進行します。

2つの古い道 vs SeedRealtime
古い道1
カスケード直列
ASR→理解→TTS、遅延蓄積、情報損失
vs
古い道2
エンドツーエンド+外付けVAD
スムーズだが外部ルールでターンを判断、一問一答
vs
新しい道
統一エンドツーエンド
感知/理解/決定/表現が同時に、モデル自身でリズムを判断
決定的な違いは「誰がいつ話すかを判断するか」です。外部ルールから、モデルが連続した音声・映像の流れの中で継続的に判断するようになります。
逆説的

難しいのは聞くことではなく、いつ話すかを知ること

公式の技術解説で最も逆説的だった点は、音声は比較的簡単だが、映像が真の課題であるということです。

音声には自然な性質があり、モデルは休止を利用して「あなたが話し終わったので、私の番です」と判断できます。しかし映像は常にオンで、絶えず変化しているため、モデルは画面内で何が起こっているのかを継続的に理解しなければなりませんが、少しの風が吹いただけで口を挟むわけではありません——それは継続的に判断しなければなりません:どのオブジェクトに注意を向けるべきか、誰の話を聞いているべきか、今すぐ反応すべきかどうか。

これが「耐干渉性」の真価です。公式の事例には2つ、非常に示唆に富むものがあります。北京の大興空港で、同伴者の雑談で「老李のフライト」が話題になったとき、モデルはそれとは無関係な会話に反応しませんでした。ユーザーが正式に質問したときになって初めて、画面で見た情報を組み合わせて回答しました。子供に英語を教えるとき、背景に父親が電話中で人の声が絶えずしている中、モデルは子供の指先に従って発音の訂正や文章の作成を続けていました——出るべきときにためらわず、干渉を受けても迷わない

一言で判断

全二重の技術的ハードルは「どれだけはっきり聞けるか」ではなく「いつ話すか」です。ターン判断を外部ルールからモデル内部に取り込むことが、今回の発表で本当に乗り越えたハードルです。

シーン

7つの公式事例の中で最も注目すべき3つの事例

発表資料では7つの実際のシーン事例が紹介されています。「人物認識」や「翻訳」といった直感的な能力をさておき、3つの事例が最も「見ながら、聞きながら、話す」の真価を体現しています:

3つの高価値事例
1

博物館での「目標リマインダー」:あなたが「錯金銀銅虎噛鹿屏座を見かけたら教えて」と頼むと、映像が絶えず移動する中で画面を注意深く監視し、展示品を見つけると声を出してリマインドし、さらにこの文物の工芸について説明します——タスクはコンテキストに保存され、目標が現れたときにトリガーされます。

2

コーヒーマシンでの「リアルタイムエラー訂正」:あなたが挽いていないコーヒー豆をそのまま抽出ハンドルに注ぐと、その場で「まず細かく挽く必要があります」と指摘します。抽出が終わると、カップの中の油の状態を見て「次に2-3秒短くする」と提案します——誰も質問していないのに、映像に基づいて能動的にコメントします。

3

空港での「雑談記憶」:同伴者の雑談で「老李のフライト」が話題になったとき、誤ってトリガーされることなく記憶します。ユーザーが正式に質問すると、たとえフライト情報が画面から消えていても、大画面情報を呼び出して回答し、さらにネットで荷物置き場の位置を補います。

この3つの事例の共通点は、モデルが「質問されて答える」のではなく、継続的に観察し、適切なタイミングで介入することです。以下の公式デモ動画 2 本は、それぞれ博物館リマインダーと空港の雑談記憶に対応しています。もちろん、これらはすべて公式のデモンストレーションシーンであり、実際の環境での失敗率は自分で試してみるまでわかりません。

公式デモ①:博物館「ターゲットリマインダー」——カメラが展示品を捉えた瞬間に声を出して解説 · 出典:バイトダンス Seed 公式発表

公式デモ②:空港「雑談記憶」——無関係な雑談には反応せず、正式に聞かれたら先ほど見たフライト情報を呼び出す · 出典:バイトダンス Seed 公式発表

体験

今日から体験できるが、「騒がしさ」で試すべき

体験のハードルは低いが、「どのように試すか」が重要だ。

体験と評価のチェックリスト
1

入口:豆包アプリを最新版にアップデートし、チャットボックスの「電話」を選択し、動画通話のインターフェースに入ればよい。

2

耐干渉性を試す:実際の騒がしいシーン(食事会、地下鉄、子供連れ)を探し、バックグラウンドで雑談しながら会話をして、モデルが他の人の雑談に流されたり、勝手に割り込んだりしないかどうかを確認する。

3

能動性を試す:モデルに「XXを見かけたら教えて」というタスクを与え、画面をスキャンする際に正確にトリガーされるかどうかを確認する。

4

口径を覚える:「リズム問題が半分に減少」は公式のエンドツーエンドの人為的評価の言い方であり、第三者による再評価はない。あなたの実際の体験がどんなスコアよりも信頼できる。

SeedRealtimeが乗り越えたハードルは「どれだけはっきり聞けるか」ではなく「いつ話すか」です。見る、聞く、話すことを同じエンドツーエンドモデルに統合し、ターン判断を外部ルールからモデル自身の継続的な決定に変える——これが「トランシーバー型AI」から「対面型AI」への分水嶺です。豆包はすでにフル実装されており、チャットボックスの「電話」を選択すれば試すことができます。直接あなたの騒がしい日常で試すことをお勧めします。デモを信用しないでください。

本文の情報はバイトダンスSeed公式発表資料(2026年8月5日)に基づいています。「対話リズム問題が半分に減少」は公式のエンドツーエンドの人為的評価の言い方であり、第三者による独立した再評価は見られません。7つの事例はすべて公式のデモンストレーションシーンです。体験入口:豆包アプリ最新版「電話」動画通話。