タグ / #マルチモーダル
#マルチモーダル
全 2 本 · 新着順
無料
LAUNCH
バイトダンスがSeedRealtimeを発表:視聴しながら会話する、オーディオ・ビデオ全二重通信が豆包で実装
バイトダンスのSeedがネイティブオーディオ・ビデオ全二重通信の大規模モデルSeedRealtimeを発表:音声、ビデオ、テキストを統合したアーキテクチャで、視聴しながら会話が可能になり、ノイズの多い環境でも発言のタイミングを判断。エンドツーエンドの評価では、会話を中断する問題がカスケード方式に比べて半分に減少。豆包アプリに全面導入済みで、ビデオ通話のエントリーポイントから直接体験可能。
▶ ポッドキャスト
08-05 · 7 分
無料
LAUNCH
MiniMax H3:1つのモデルで動画+立体音響を生成、2Kで1秒あたり約8円、さらにオープンソース化
MiniMaxが初のオープンソース多モード生成モデルH3を発表:1つのモデルでテキスト、画像、動画、音声を統合的に理解し、2K解像度+ネイティブ立体音響の15秒動画を生成可能。価格は1秒あたり0.8元で、同類のフラッグシップモデルの3分の1以下。Artificial Analysisの動画編集能力はグローバルでトップです。技術路線と価格設定を分析し、何を節約できるかをお伝えします。
▶ ポッドキャスト
08-01 · 7 分