操盘手册

模型报告2026年8月27日9 分钟阅读

MiniMax H3 正式上线 Yihook:体验 15 秒 2K 多模态 AI 视频生成

统一理解文字、图片、视频和音频参考,最高 15 秒、2K 分辨率和原生双声道。MiniMax H3 已上线 Yihook。

免费试第一条一个商品链接就够。
Yihook 模型报告封面:MiniMax H3 15 秒 2K 多模态视频生成。
模型报告yihook

MiniMax H3 已正式上线 Yihook。作为一款全模态生成模型,它支持文字、图片、视频和音频参考,可生成最长 15 秒、最高 2K 并带有原生立体声音频的视频,适合广告、电商、UGC 和品牌内容创作。

MiniMax H3 的核心能力

1. 统一理解文字、图片、视频和音频

MiniMax H3 最重要的变化,是多模态上下文理解能力。

在普通的图生视频工作流中,模型主要根据一张图片和一段提示词生成动态画面。H3 可以同时接收不同类型的参考信息,并理解这些素材与目标视频之间的关系。

如下面这个镜头,Prompt 为“参考视频 1 的希区柯克镜头运动,让图 2 中的人物唱歌,歌声参考音频 3”。

输入

视频 1

统一理解输入图片

图 2

音频 3

输出

对于广告、电商和品牌内容,这类工作流更接近真实的创意制作过程。商业团队通常已经拥有产品图、历史广告、品牌规范、脚本、竞品参考和声音素材,H3 可以让这些现有资产直接参与视频生成。

2. 最高支持 15 秒和 2K 分辨率

MiniMax H3 最高支持生成 15 秒、2K 分辨率的视频。官方开放版本提供 4 至 15 秒的输出时长,并支持多种横竖屏比例。

H3 的 2K 输出采用 In-context Regeneration 技术。

传统超分辨率方法通常根据低清画面推测缺失细节。H3 会重新利用原始提示词、参考图片、视频和音频等多模态上下文,对低分辨率结果进行高分辨率再生成。

根据 MiniMax 的技术说明,这种方法可以帮助模型重新利用原始上下文信息,改善小文字、物体纹理和局部画面细节的还原。

对于产品广告、品牌海报、界面展示和带有文字元素的视频来说,细节保留能力尤其重要。

2K 分辨率案例

3. 原生双声道音频生成

MiniMax H3 可以在生成视频的同时输出原生双声道音频。

过去的 AI 视频工作流通常需要分别完成视频生成、配音、音乐、环境音和音效,再通过后期工具进行合成。H3 将音频和视频纳入统一建模,能够在一次生成任务中同时处理画面与声音。

MiniMax 官方开放版本提供 32 kHz 立体声音频输出,并支持人声、音效和音乐的联合建模。

原生双声道案例,建议佩戴耳机体验。

这项能力适合用于:

  • 带环境声的产品展示
  • 包含对白的短剧情
  • 具有音乐和音效的广告片
  • 电影感品牌短片
  • 社交媒体短视频
  • 游戏概念视频

具体音频效果仍然取决于提示词、语言、场景复杂度和当前产品端提供的生成参数。

4. 原生多镜头建模

MiniMax H3 在预训练阶段加入了原生多镜头建模。

创作者可以在提示词中描述不同镜头的顺序、景别、动作和转场关系,让模型理解一个视频中连续发生的多个画面。

输入 输出
多镜头输入图片 1 多镜头输入图片 2 多镜头输入图片 3 多镜头输入图片 4

多镜头能力能够让视频从单一动态画面,逐步接近具有开场、发展和结尾的短叙事。

它适合用于广告分镜、产品介绍、预告片、品牌短片和社交媒体内容。不过,镜头数量越多,人物、产品和场景的一致性控制难度通常也会随之提高。

5. 视频到视频动作迁移

MiniMax 官方特别提到了 H3 的 V2V Motion Transfer,也就是视频到视频动作迁移能力。

创作者可以使用现有视频提供动作、表演或镜头运动参考,再将这些运动关系迁移到新的角色、产品或视觉场景中。

输入
动作迁移目标人物图片

目标人物与场景图片

动作参考视频

输出

对于 AI UGC、人物表演和短视频广告来说,动作参考能够减少仅靠文字描述运动时产生的不确定性。

潜在应用包括:

  • 将真人动作迁移到虚拟人物
  • 参考已有广告的镜头节奏
  • 让指定角色执行特定表演
  • 复用产品展示动作
  • 参考运镜方式生成新的视觉内容

使用动作参考时,应明确说明参考视频的用途。例如,提示词中可以写清楚“仅参考身体动作”“参考镜头运动,不复制人物外观”或“保留目标图片中的产品设计”。

6. 面向商业内容的指令遵循

MiniMax 将广告、品牌、电商、产品设计、UI/UX 和游戏列为 H3 的主要商业应用方向。

官方表示,H3 在指令遵循、文字与品牌信息呈现、多模态编辑和视频动作迁移等方面具有较强表现。

电影片头 产品宣传
品牌广告 游戏 UI

对于商业视频来说,视觉冲击力只是一部分要求。模型还需要理解产品主体、品牌元素、镜头方向、动作要求、画面比例和内容用途。

H3 的优势在于,团队可以同时使用提示词与参考素材表达创作需求,减少仅依赖文字提示词带来的信息损失。

提升 MiniMax H3 生成效果的建议

首先,明确每个参考素材的作用。不要只上传多个文件,应说明哪个素材负责人物、哪个负责产品、哪个负责动作、哪个负责声音。

其次,把主体一致性要求写具体。对于产品,应描述颜色、结构、材质、包装和 Logo;对于人物,应描述面部、服装、发型和身体特征。

再次,复杂视频应拆分镜头。分别描述每个镜头的景别、动作、时间顺序和转场,通常比笼统描述整个故事更稳定。

同时,声音要求也应具体。可以分别描述对白、环境声、动作音效和背景音乐,避免只写“添加合适的声音”。

最后,一次生成不要加入过多相互冲突的参考信息。多模态输入可以提供更多控制,也会增加模型需要理解的关系数量。

MiniMax H3 已正式上线 Yihook

Yihook 已完成 MiniMax H3 的接入,你可以把 MiniMax H3 用于以下内容场景:

内容场景 使用方式 适用渠道或价值
电商产品视频 上传产品图片,通过提示词描述使用环境、展示动作、镜头运动和视觉风格,将静态商品素材转化为动态视频。 商品详情页、TikTok、Instagram Reels、YouTube Shorts 和广告投放素材。
AI 广告创意 围绕同一产品生成不同场景、镜头、情绪和风格的广告创意。 快速制作棚拍、生活方式、电影感和社交媒体原生内容,用于测试不同创意方向。
UGC 风格短视频 通过人物参考、场景描述和动作要求,生成接近用户分享、产品体验或口播情境的视频。 批量拓展同一产品的广告变体和创意空间。
品牌视觉与概念视频 使用品牌图片、视觉参考和文字描述生成动态海报、品牌概念片、活动预告和产品发布视觉。 用于前期视觉探索、创意提案和品牌传播。
参考动作与镜头生成 上传参考素材,并说明需要保留的动作、运镜或视觉关系,再生成具有新主体和新场景的视频。 减少仅靠文字描述动作与镜头时的不确定性,提升生成可控性。

立即前往 Yihook,使用 MiniMax H3 创建你的下一条 AI 视频。

一个商品,多种卖法

别再猜哪条卖法有效。

带上一个商品链接,Yihook 会推演不同购买理由,并为每种卖法生成可测试的视频,让 TikTok 的数据告诉你哪条真正有效。

免费试第一条第一条 HookReel 视频可以免费试。