MiniMax H3 视频生成 —— 多模态参考,5 到 15 秒任意时长,2K 输出
MiniMax H3 可以同时拿图片、视频和音频当参考,输出 2K,时长在 5 到 15 秒之间任选整数秒。在心宇 AI 上和其他模型共用一个积分余额。
可用版本
- MiniMax H32K 输出;5–15 秒任意整数秒;支持文生视频、图生视频、参考生视频与多模态参考;可指定尾帧
它擅长什么
图、视频、音频可以一起当参考
H3 的多模态参考不限于图片 —— 视频片段和音轨也能进同一条提示词,用来定调子和节奏。
时长是 5 到 15 秒任选
不是只有 5 秒和 10 秒两档,中间每一个整数秒都能选,剪辑时不用再补帧或硬切。
可以指定尾帧
给定首帧和尾帧,让镜头落在你要的画面上,接下一个镜头时更好衔接。
为什么在心宇 AI 上跑
一个余额跑所有模型
图片、视频、音频、文字共用同一个积分余额,不用为每个模型单独订阅、单独充值。积分永不过期。
在同一块画布里串起来
生成的图可以直接当下一步的参考图,视频可以接着剪、延长、配音 —— 不用在多个工具之间导出再导入。
MCP 与命令行都能调
在 Claude、Cursor 里直接生成,或者用 CLI 接进自己的脚本和自动化流程,不必开网页。
常见问题
MiniMax H3 能输出多长的视频?
5 到 15 秒之间任意整数秒,不是固定几个档位。输出分辨率为 2K。
「多模态参考」具体是什么意思?
同一条提示词里可以同时给图片、视频片段和音频当参考,而不只是一张参考图 —— 视频用来定运动和节奏,音频用来定调子。
H3 支持纯文字生成吗?
支持。文生视频、图生视频、参考生视频三种输入方式都可以,也可以指定尾帧。
用参考图或参考视频时要注意什么?
H3 的上游会对传入的参考媒体做内容审核,不合规的参考素材会被拒绝并自动退回积分。如果参考素材反复被拒,可以改用纯文字生成,或者换到画布里的其他视频模型。