MiniMax H3 已正式上线 Yihook。作为一款全模态生成模型,它支持文字、图片、视频和音频参考,可生成最长 15 秒、最高 2K 并带有原生立体声音频的视频,适合广告、电商、UGC 和品牌内容创作。
MiniMax H3 的核心能力
1. 统一理解文字、图片、视频和音频
MiniMax H3 最重要的变化,是多模态上下文理解能力。
在普通的图生视频工作流中,模型主要根据一张图片和一段提示词生成动态画面。H3 可以同时接收不同类型的参考信息,并理解这些素材与目标视频之间的关系。
如下面这个镜头,Prompt 为“参考视频 1 的希区柯克镜头运动,让图 2 中的人物唱歌,歌声参考音频 3”。
| 输入 | ||
|---|---|---|
|
视频 1 |
图 2 |
音频 3 |
| 输出 | ||
对于广告、电商和品牌内容,这类工作流更接近真实的创意制作过程。商业团队通常已经拥有产品图、历史广告、品牌规范、脚本、竞品参考和声音素材,H3 可以让这些现有资产直接参与视频生成。
2. 最高支持 15 秒和 2K 分辨率
MiniMax H3 最高支持生成 15 秒、2K 分辨率的视频。官方开放版本提供 4 至 15 秒的输出时长,并支持多种横竖屏比例。
H3 的 2K 输出采用 In-context Regeneration 技术。
传统超分辨率方法通常根据低清画面推测缺失细节。H3 会重新利用原始提示词、参考图片、视频和音频等多模态上下文,对低分辨率结果进行高分辨率再生成。
根据 MiniMax 的技术说明,这种方法可以帮助模型重新利用原始上下文信息,改善小文字、物体纹理和局部画面细节的还原。
对于产品广告、品牌海报、界面展示和带有文字元素的视频来说,细节保留能力尤其重要。
2K 分辨率案例
3. 原生双声道音频生成
MiniMax H3 可以在生成视频的同时输出原生双声道音频。
过去的 AI 视频工作流通常需要分别完成视频生成、配音、音乐、环境音和音效,再通过后期工具进行合成。H3 将音频和视频纳入统一建模,能够在一次生成任务中同时处理画面与声音。
MiniMax 官方开放版本提供 32 kHz 立体声音频输出,并支持人声、音效和音乐的联合建模。
原生双声道案例,建议佩戴耳机体验。
这项能力适合用于:
- 带环境声的产品展示
- 包含对白的短剧情
- 具有音乐和音效的广告片
- 电影感品牌短片
- 社交媒体短视频
- 游戏概念视频
具体音频效果仍然取决于提示词、语言、场景复杂度和当前产品端提供的生成参数。
4. 原生多镜头建模
MiniMax H3 在预训练阶段加入了原生多镜头建模。
创作者可以在提示词中描述不同镜头的顺序、景别、动作和转场关系,让模型理解一个视频中连续发生的多个画面。
| 输入 | 输出 |
|---|---|
|
多镜头能力能够让视频从单一动态画面,逐步接近具有开场、发展和结尾的短叙事。
它适合用于广告分镜、产品介绍、预告片、品牌短片和社交媒体内容。不过,镜头数量越多,人物、产品和场景的一致性控制难度通常也会随之提高。
5. 视频到视频动作迁移
MiniMax 官方特别提到了 H3 的 V2V Motion Transfer,也就是视频到视频动作迁移能力。
创作者可以使用现有视频提供动作、表演或镜头运动参考,再将这些运动关系迁移到新的角色、产品或视觉场景中。
| 输入 | |
|---|---|
目标人物与场景图片 |
动作参考视频 |
| 输出 | |
对于 AI UGC、人物表演和短视频广告来说,动作参考能够减少仅靠文字描述运动时产生的不确定性。
潜在应用包括:
- 将真人动作迁移到虚拟人物
- 参考已有广告的镜头节奏
- 让指定角色执行特定表演
- 复用产品展示动作
- 参考运镜方式生成新的视觉内容
使用动作参考时,应明确说明参考视频的用途。例如,提示词中可以写清楚“仅参考身体动作”“参考镜头运动,不复制人物外观”或“保留目标图片中的产品设计”。
6. 面向商业内容的指令遵循
MiniMax 将广告、品牌、电商、产品设计、UI/UX 和游戏列为 H3 的主要商业应用方向。
官方表示,H3 在指令遵循、文字与品牌信息呈现、多模态编辑和视频动作迁移等方面具有较强表现。
| 电影片头 | 产品宣传 |
|---|---|
| 品牌广告 | 游戏 UI |
对于商业视频来说,视觉冲击力只是一部分要求。模型还需要理解产品主体、品牌元素、镜头方向、动作要求、画面比例和内容用途。
H3 的优势在于,团队可以同时使用提示词与参考素材表达创作需求,减少仅依赖文字提示词带来的信息损失。
提升 MiniMax H3 生成效果的建议
首先,明确每个参考素材的作用。不要只上传多个文件,应说明哪个素材负责人物、哪个负责产品、哪个负责动作、哪个负责声音。
其次,把主体一致性要求写具体。对于产品,应描述颜色、结构、材质、包装和 Logo;对于人物,应描述面部、服装、发型和身体特征。
再次,复杂视频应拆分镜头。分别描述每个镜头的景别、动作、时间顺序和转场,通常比笼统描述整个故事更稳定。
同时,声音要求也应具体。可以分别描述对白、环境声、动作音效和背景音乐,避免只写“添加合适的声音”。
最后,一次生成不要加入过多相互冲突的参考信息。多模态输入可以提供更多控制,也会增加模型需要理解的关系数量。
MiniMax H3 已正式上线 Yihook
Yihook 已完成 MiniMax H3 的接入,你可以把 MiniMax H3 用于以下内容场景:
| 内容场景 | 使用方式 | 适用渠道或价值 |
|---|---|---|
| 电商产品视频 | 上传产品图片,通过提示词描述使用环境、展示动作、镜头运动和视觉风格,将静态商品素材转化为动态视频。 | 商品详情页、TikTok、Instagram Reels、YouTube Shorts 和广告投放素材。 |
| AI 广告创意 | 围绕同一产品生成不同场景、镜头、情绪和风格的广告创意。 | 快速制作棚拍、生活方式、电影感和社交媒体原生内容,用于测试不同创意方向。 |
| UGC 风格短视频 | 通过人物参考、场景描述和动作要求,生成接近用户分享、产品体验或口播情境的视频。 | 批量拓展同一产品的广告变体和创意空间。 |
| 品牌视觉与概念视频 | 使用品牌图片、视觉参考和文字描述生成动态海报、品牌概念片、活动预告和产品发布视觉。 | 用于前期视觉探索、创意提案和品牌传播。 |
| 参考动作与镜头生成 | 上传参考素材,并说明需要保留的动作、运镜或视觉关系,再生成具有新主体和新场景的视频。 | 减少仅靠文字描述动作与镜头时的不确定性,提升生成可控性。 |
立即前往 Yihook,使用 MiniMax H3 创建你的下一条 AI 视频。
一个商品,多种卖法
别再猜哪条卖法有效。
带上一个商品链接,Yihook 会推演不同购买理由,并为每种卖法生成可测试的视频,让 TikTok 的数据告诉你哪条真正有效。
