标签 / #多模态
#多模态
共 2 篇 · 按时间倒序
免费
LAUNCH
字节发布 SeedRealtime:边看边听边说,音视频全双工上线豆包
字节 Seed 发布原生音视频全双工大模型 SeedRealtime:统一架构融合音频、视频与文本,能边看边听边说、在嘈杂里判断何时开口,端到端评测中对话节奏问题比级联方案少一半。已在豆包 App 全量上线,视频通话入口可直接体验。
▶ 听播客
08-05 · 7 分钟
免费
LAUNCH
MiniMax H3:一个模型同时出视频+立体声,2K 每秒 8 毛,还开源
MiniMax 发布首款开源多模态生成模型 H3:一个模型统一理解文本、图片、视频、音频,直出 2K 分辨率 + 原生立体声的 15 秒视频。定价 0.8 元/秒,不到同类旗舰的三分之一。Artificial Analysis 视频编辑能力全球第一。我们拆了技术路线和定价,帮你想清楚它能替你省什么。
▶ 听播客
08-01 · 7 分钟