7 月 31 日,MiniMax 发布了一个让内容创作者该重新算账的模型:H3。它不是「又一个视频生成器」——它是一个模型同时搞定视频、图片、音频的生成和编辑,直出 2K 分辨率 + 原生立体声,最长 15 秒。定价 0.8 元/秒,不到同类旗舰的三分之一。而且,权重(模型的核心文件,拿到就能自己跑)即将开源。

以前做一条 15 秒的短视频广告,你得凑齐一个团队:摄影师管画面、配音师管声音、剪辑师管节奏、特效师管后期。四个人,四套工具,四次沟通。现在来了一个瑞士军刀型选手:你用一句话描述「参考这个镜头感,让这个角色唱这首歌,背景换成这个场景」,它直接交一条带立体声的 2K 成片。类比到此为止,实际差别是:瑞士军刀每样都不如专业工具精,但 H3 在视频编辑这项上已经是全球第一。
事件

一个模型干完全部活:视频、图片、音频、编辑

H3 的核心卖点不是「生成视频」——这个赛道已经挤满了选手。它的卖点是统一:文本、图片、视频、音频——四大模态(行话:AI 能处理的各种信息形式),在同一个模型里理解、生成、编辑、参考,不再需要拼凑多个工具。

具体来说:你可以给它一段视频说「参考这个镜头运动」,给一张图说「让这个角色出镜」,给一段音频说「配上这个声音」——H3 在同一个上下文里理解所有输入,一次性输出结果。官方演示里,一句「参考 Video 1 的希区柯克运镜,让 Image 2 的角色唱 Audio 3 的歌」,直接出片。

MiniMax H3 多模态上下文输入示例:视频 + 图片 + 音频组合输入
H3 多模态上下文输入示例:参考视频运镜 + 角色图片 + 音频,一次性生成结果 · 来源:MiniMax 官方博客

这背后是 MiniMax 从 Hailuo 01 → Hailuo 02 → H3 三代积累的路线选择:第一代建系统,第二代磨组件,第三代砍掉任务边界。不再区分 T2I、T2V、T2A、编辑、参考——全部统一进一个架构,用自然语言描述任务关系。

2K
默认输出分辨率
不是超分后处理,是 H3-VAE 高压缩比直接支撑的原生 2K 生成。来源:MiniMax 官方。
立体声
原生音频输出
人声、音效、音乐不分开建模,联合生成原生立体声。来源:MiniMax 官方。
15 秒
单次生成时长
支持多镜头原生建模,不是拼接。来源:MiniMax 官方。
数字

0.8 元/秒:一条 15 秒广告片素材成本 12 元

定价是最直接的语言。H3 的 2K 视频生成价格为 0.8 元/秒。官方说法是「不到业内同类旗舰视频模型的三分之一」——多家媒体(每日经济新闻、东方财富)交叉确认了这个数字。

换算一下:一条 15 秒的 2K 广告素材,成本 12 元。768p 更便宜,不到主流模型 720p 价格的一半。这个价格意味着什么?意味着「先跑一版样片看看效果」的试错成本几乎为零——以前你可能因为「生成一次太贵」而只在最终方案确定后才跑视频,现在可以在脑暴阶段就出片验证。

为什么这么便宜

核心技术是 H3-VAE(新一代视频压缩器):压缩比大幅提升,有效序列长度获得 4 倍增益——同样的视频内容,需要的 token(AI 按字数收费的单位,1 个汉字约合 1~2 个)数量只有以前的四分之一。token 少了,推理成本(AI 真正用起来时花的算力钱)自然降了。这不是降价换量,是架构级的成本优势。

0.8 元
每秒 2K 视频
同类旗舰的 1/3。768p 更低,不到主流 720p 的一半。来源:MiniMax 官方 + 每日经济新闻。
No.1
AA 视频编辑排名
Artificial Analysis 视频模型榜单,视频编辑能力项全球第一。来源:Artificial Analysis。
+20%
港股开盘涨幅
发布当天 MiniMax 港股开盘涨超 20%,午间回落至约 12%,报 230 港元。来源:搜狐财经。
反直觉

不是堆模型,是砍模型

行业惯例是什么?每个任务一个专家模型:文生图一个、文生视频一个、视频编辑一个、主体参考一个、运动参考一个、风格迁移一个、配音一个、音效一个……加起来十几个模型,各有各的 API,各有各的脾气。

H3 反其道而行:全部砍掉,统一进一个架构。MiniMax 官方的原话是「任务泛化是不可逆的趋势,架构技巧应该让位于模型如何被定义」。他们甚至放弃了 Hailuo 02 的架构——尽管那个架构曾在上一代带来明确的效率优势——因为它会给「任务泛化」引入不必要的复杂度。

结果呢?一个模型干所有活,不但没有「样样通样样松」,反而在视频编辑上拿了全球第一。为什么?因为跨模态的上下文理解让模型能「看到全局」:它不是孤立地生成一帧画面,而是在理解镜头运动、角色外观、音频节奏之后,统一规划输出。

旧范式 vs H3 范式
T2I 模型
只管出图
+
T2V 模型
只管出视频
+
T2A 模型
只管出音频
+
编辑/参考/超分…
各管一摊
↓ H3:一个模型 + 一句自然语言描述 = 全部搞定
格局

视频生成从「玩具」变成「生产力」

过去两年,视频生成模型的身份是「技术 demo」——看起来酷,但分辨率低、没声音、不可控、太贵,进不了真正的生产流程。H3 的发布是一个转折点:视频生成开始具备商业级生产的条件

三个信号:第一,2K + 立体声意味着输出可以直接交付客户,不需要后期再补声音、再拉分辨率。第二,0.8 元/秒意味着试错成本趋近于零——可以在创意阶段就出片验证,不用等到方案定稿。第三,即将开源意味着企业可以私有化部署——微调(拿自家素材再训练,让它更贴合你)自有模型,数据出域(素材不传到别人的服务器)也不用担心。

MiniMax 官方列的目标场景很明确:广告、品牌、电商、产品设计、UI/UX、游戏。注意,不是「影视」——15 秒的长度和当前画质还做不了电影。但做一条电商产品视频、一个 App 启动动画、一组社交媒体素材?够了。

MIT 级
开源预期
官方称「未来几天」开放权重,企业可本地部署 + 微调。来源:MiniMax 官方 + 网易。
12 元
一条 15 秒 2K 素材
0.8 元/秒 × 15 秒。试错成本几乎为零。来源:按官方定价计算。
30%
训练吞吐提升
H3-Omni Transformer 分离理解/生成负载,端到端训练吞吐提升近 30%。来源:MiniMax 官方。
动手

谁该现在就去跑一轮样片

H3 的 API 已经上线。如果你属于以下任何一种人,今天就可以去跑样片验证:

优先测试的四种场景
1

电商/广告素材:产品图 → 15 秒展示视频,带背景音乐和音效。以前外包一条 500 元起,现在 12 元跑一版。

2

App/游戏 UI 演示:用 V2V 动作参考 + 品牌色渲染,快速出产品宣传动画。

3

社交媒体内容:多镜头原生建模,一条指令出多段连贯画面,不用逐段拼接。

4

需要私有化部署的企业:等权重放出(「未来几天」),本地部署 + 喂自家素材微调,数据不出域。

快速上手
APIMiniMax 官方 API,支持文本/图片/视频/音频多模态输入
输出2K 分辨率 + 原生立体声,最长 15 秒,0.8 元/秒
开源权重「未来几天」放出,届时可本地部署(关注 MiniMax 官方公告)
适合广告/电商/产品演示/游戏 UI/社交媒体,不适合影视级长片

当一个模型能同时搞定视频+图片+音频,2K 每秒 8 毛,还即将开源的时候,「拼凑多个工具」的思路就该升级了。今天能做的第一件事:拿你手头最重复的那类素材需求,去 H3 API 跑一版样片。12 块钱的成本,数据会替你做决定。

定价与排名数据来自 MiniMax 官方博客及 Artificial Analysis 第三方榜单,经每日经济新闻、东方财富、网易等多家媒体交叉确认。技术细节(H3-VAE、Omni Transformer、In-Context Regeneration)为厂商描述,完整技术报告即将发布。开源时间以 MiniMax 官方公告为准。