7月31日、ミニマックスはコンテンツクリエイターが計算し直す必要のあるモデルを発表しました:H3。これは「また別のビデオジェネレーター」ではありません——これは1つのモデルでビデオ、画像、音声の生成と編集を同時に行い、2K解像度+ネイティブステレオサウンドを直接出力し、最長15秒の長さに対応します。価格は1秒あたり0.8元で、同類のフラッグシップモデルの3分の1以下です。しかも、重み(モデルの心臓部ファイル、手に入れれば自前で動かせる)は間もなくオープンソース化される予定です。

以前は15秒の短いビデオ広告を作るために、あなたはチームを集める必要がありました:カメラマンが映像を担当し、ナレーターが音声を担当し、編集者がリズムを担当し、エフェクトアーティストが後処理を担当します。4人、4セットのツール、4回のコミュニケーション。今、一人のスイスアーミーナイフのような選手が現れました:あなたは一言で「このようなカメラワークを参考に、このキャラクターにこの曲を歌わせ、背景をこのシーンに変更」と伝えるだけで、それが直接ステレオサウンド付きの2K完成品を提出します。たとえ話はここまでですが、実際の違いは:スイスアーミーナイフはどの機能も専門ツールほど優れてはいませんが、H3はビデオ編集の分野ではすでに世界一です。
イベント

一つのモデルで全てをこなす:ビデオ、画像、音声、編集

H3の主な売りは「ビデオを生成する」ことではありません——この分野にはすでに多くの競合がいます。その売りは統一です:テキスト、画像、ビデオ、オーディオの4つのモダリティ(業界用語:AIが扱える情報の形態)が、同じモデル内で理解、生成、編集、参照され、複数のツールを組み合わせて使う必要がなくなります。

具体的には言えば:あなたはビデオの一部分を渡して「このようなカメラワークを参考に」と言ったり、画像を一枚渡して「このキャラクターを出演させて」と言ったり、オーディオの一部を渡して「この音を付けて」と言ったりすることができます——H3は同じコンテキストで全ての入力を理解し、一度に結果を出力します。公式のデモでは、「Video 1のヒッチコック的カメラワークを参考に、Image 2のキャラクターにAudio 3の曲を歌わせる」という一言で、直接完成品が出てきます。

これはミニマックスがHailuo 01 → Hailuo 02 → H3と三代にわたって積み重ねてきた選択の成果です:第一世代でシステムを構築し、第二世代でコンポーネントを磨き、第三世代でタスクの境界を排除しました。もはやT2I(テキストから画像生成、Vはビデオ、Aはオーディオ)、T2V、T2A、編集、参照を区別せず——全てを一つのアーキテクチャに統一し、自然言語でタスクの関係性を記述します。

2K
デフォルト出力解像度
超解像後処理ではなく、H3-VAEの高圧縮比が直接支えるネイティブ2K生成。出典:ミニマックス公式。
ステレオサウンド
ネイティブオーディオ出力
ボーカル、音響、音楽を分けてモデリングせず、連合でネイティブステレオサウンドを生成。出典:ミニマックス公式。
15秒
単一生成の長さ
複数カメラのネイティブモデリングをサポートし、継ぎ接ぎではありません。出典:ミニマックス公式。
数字

0.8元/秒:15秒の広告素材コストは12元

価格は最も直接的な言語です。H3の2Kビデオ生成価格は0.8元/秒です。公式の説明では「業界内の同類フラッグシップビデオモデルの3分の1以下」です——複数のメディア(毎日経済新聞、東方財富)がこの数字を確認しています。

換算すると:15秒の2K広告素材、コストは12元です。768pはもっと安く、主要なモデルの720p価格の半分以下です。この価格は何を意味するのか?それは「まず試作版を走らせて効果を見てみる」という試行錯誤のコストがほぼゼロになったことを意味します——以前は「生成一回がコスト高すぎる」ため、最終案が決まるまでビデオを走らせなかったかもしれませんが、今ではブレインストーミング段階で出力を検証することができます。

なぜこんなに安いのか

コア技術はH3-VAE(第3世代ビデオ圧縮機):圧縮率が大幅に向上し、有効シーケンス長が4倍に増えました——同じビデオコンテンツでも、必要なトークン(AIが文字数で課金する単位)数は以前の4分の1です。トークンが少ないと、推論コスト(AIを動かすときにかかる計算費用)は自然に下がります。これは値下げによる量増しではなく、アーキテクチャレベルのコスト優位性です。

0.8元
2Kビデオ1秒あたり
同類のフラッグシップの3分の1。768pはさらに低く、主要な720pの半分以下。出典:ミニマックス公式+毎日経済新聞。
No.1
AAビデオ編集ランキング
Artificial Analysisビデオモデルリストで、ビデオ編集能力部門で世界一。出典:Artificial Analysis。
+20%
香港株の初値上昇率
発表当日にミニマックス香港株は20%以上上昇し、昼過ぎには約12%まで戻り、230香港ドルで取引されました。出典:搜狐財経。
直感的でない

モデルを積み重ねるのではなく、モデルを削減する

業界の慣習は何でしょうか?各タスクに専門家モデルを用意する:テキストから画像生成が一つ、テキストからビデオ生成が一つ、ビデオ編集が一つ、主体参照が一つ、動き参照が一つ、スタイル転送が一つ、ナレーションが一つ、音響効果が一つ...合わせて十数個のモデル、それぞれにAPIがあり、それぞれに癖があります。

H3はそれとは逆に進みます:全てを削減し、一つのアーキテクチャに統一します。ミニマックス公式の言葉は「タスクの汎化は不可逆のトレンドであり、アーキテクチャの技巧はモデルがどのように定義されるかに譲るべき」です。彼らはHailuo 02のアーキテクチャさえも放棄しました——そのアーキテクチャはかつて顕著な優位性をもたらしましたが、「タスクの汎化」に不要な複雑さを導入するためです。

その結果はどうなったか?一つのモデルですべてのタスクをこなし、「どれもそこそこ」ということはなく、逆にビデオ編集で世界一を獲得しました。なぜか?なぜなら、クロスモダリティのコンテキスト理解がモデルに「全体像を見る」ことを可能にするからです:それは孤立して一フレームの映像を生成するのではなく、レンズの動き、キャラクターの外見、オーディオのリズムを理解した後に、出力を統一的に計画するのです。

旧来のパラダイム vs H3パラダイム
T2Iモデル
画像生成のみ担当
+
T2Vモデル
ビデオ生成のみ担当
+
T2Aモデル
オーディオ生成のみ担当
+
編集/参照/超解像…
それぞれ担当
↓ H3:一つのモデル+一つの自然言語記述=全てをこなす
構図

ビデオ生成が「玩具」から「生産力」に変わる

過去2年間、ビデオ生成モデルの立場は「技術デモ」でした——見た目はクールですが、解像度が低く、音がなく、制御できず、あまりにも高価で、実際の生産プロセスには入り込めませんでした。H3の発表は一つの転換点をマークしています:ビデオ生成が商業レベルの生産条件を持ち始めました

3つのシグナルがあります:第一に、2K+ステレオサウンドは出力を直接顧客に納品できることを意味し、後で音を補ったり、解像度を上げたりする必要がありません。第二に、0.8元/秒は試行錯誤のコストがほぼゼロになることを意味します——創造的な段階で出力を検証することができ、案が確定するまで待つ必要はありません。第三に、オープンソース化される予定であることは、企業が自社製品画像やブランド素材を投入して微調整(自社素材で再学習させ、用途に合わせること)を行い、データ漏洩を心配する必要がないことを意味します。

ミニマックス公式が挙げた目標シーンは非常に明確です:広告、ブランド、eコマース、製品デザイン、UI/UX、ゲーム。注意すべきは、「映画」は含まれていないことです——15秒の長さと現在の画質では映画制作はまだできません。しかし、eコマース製品のビデオ、アプリの起動アニメーション、ソーシャルメディア素材のセットを作るには十分です。

MIT級
オープンソース化の期待
公式には「数日以内に」重みを開放し、企業はローカルに展開+微調整が可能。出典:ミニマックス公式+ネットイース。
12元
15秒の2K素材1本
0.8元/秒×15秒。試行錯誤のコストはほぼゼロ。出典:公式価格に基づいて計算。
30%
トレーニングスループット向上
H3-Omni Transformerが理解/生成負荷を分離し、エンドツーエンドのトレーニングスループットが30%近く向上。出典:ミニマックス公式。
行動

今すぐにでも試作版を走らせるべきなのは誰か

H3のAPIはすでにオンラインになっています。もしあなたが以下のいずれかに該当する場合、今すぐ試作版を走らせて検証することができます:

優先的にテストすべき4つのシナリオ
1

EC/広告素材:製品画像→15秒の展示ビデオ、背景音楽と効果音付き。以前はアウトソーシングで1本500元から、今は12元で一版を走らせることができます。

2

アプリ/ゲームUIデモ:V2V動作参照+ブランドカラーレンダリング、素早く製品プロモーションアニメーションを作成。

3

ソーシャルメディアコンテンツ:複数カメラのネイティブモデリング、一つの指示で複数の一貫した映像を出力し、継ぎ接ぎする必要がありません。

4

ローカル展開を必要とする企業:重みが「数日以内」に放出され、ローカル展開+自社素材で微調整、データがドメイン外に出ない。

手早く始める
APIミニマックス公式API、テキスト/画像/ビデオ/オーディオのマルチモーダル入力に対応
出力2K解像度+ネイティブステレオサウンド、最長15秒、0.8元/秒
オープンソース重みは「数日以内」に放出され、ローカル展開が可能(ミニマックス公式発表に注目)
適している広告/EC/製品デモ/ゲームUI/ソーシャルメディア、長編映画には適していない

一つのモデルがビデオ+画像+オーディオを同時にこなせるとき、2Kで1秒あたり8毛で、オープンソース化も間近のとき、「複数のツールを組み合わせる」という考え方はアップグレードすべきです。今日できる最初のことは、手元にある最も繰り返される素材要求を持って、H3 APIで一版の試作版を走らせましょう。12元のコストで、データが代わりに決定してくれます。

価格とランキングデータはミニマックス公式ブログおよびArtificial Analysisの第三者リストから来ており、毎日経済新聞、東方財富、ネットイースなど複数のメディアで確認されています。技術的詳細(H3-VAE、Omni Transformer、In-Context Regeneration)はメーカーの説明によるもので、完全な技術報告書は間もなく発表されます。オープンソース化時間はミニマックス公式発表によるものです。