XinYu.
← 返回动态
新模型2026年8月1日

MiniMax H3 上线:图、视频、音频都能当参考

上面这段 15 秒是 H3 纯文生视频跑出来的一条仿苹果广告 ——「葱 Pro · 了不起的绿。」。没有参考图、没有后期加字:画面里的中文标题是模型自己渲染出来的。

参考素材不止是图

大多数视频模型的「参考」只认图片。H3 的参考模式可以同时接收三类素材:

  • 图片 —— 锁人物、产品、画面风格
  • 视频 —— 给动作和运镜,让新画面照着这段动
  • 音频 —— 给节奏和情绪

在画布上,把图片节点、视频节点、音频节点一起连到 H3 视频节点上,切到「多图参考」,它们会一并作为参考送进去。至少要有一张图或一段视频(只给音频不行)。

三种用法

文生视频 —— 什么都不连,直接写提示词。

图生视频 —— 连一张图作首帧;还可以再连一张作尾帧,让画面从 A 走到 B。

多模态参考 —— 就是上面那个,图 + 视频 + 音频混着给。

规格

分辨率2K(2560×1440,竖版为 1440×2560)
时长5–15 秒,逐秒可选
画幅21:9 / 16:9 / 4:3 / 1:1 / 3:4 / 9:16,图生与参考模式另有「自适应」
声音画面与音频一次生成,不是后期配的
价格17.5 Xins/秒 —— 5 秒 88、8 秒 140、15 秒 263

「自适应」是它的默认画幅:给一张竖图,它就出竖版,不会硬套成 16:9。

什么时候用它

想要动作跟着某段视频走、或者画面踩着某段音乐的节奏时,用 H3 的参考模式。单纯要锁一个角色的长相,画布上其它模型也能做,不必绕道。

本文封面就是 H3 直接生成的一帧。

MiniMax H3 上线:图、视频、音频都能当参考 | XinYu AI