操盘手册

模型报告2026年8月27日8 分钟阅读

Wan 3.0 正式上线 Yihook:体验 30 秒全能多模态 AI 视频生成

文生、图生、首尾帧和参考生视频统一进一个模型,支持文档与网页输入。最长 30 秒、原生音画、1080P,Wan 3.0 已上线 Yihook。

免费试第一条一个商品链接就够。
Yihook 模型报告封面:Wan 3.0 30 秒全能多模态视频生成。
模型报告yihook

Wan 3.0 已正式上线 Yihook。

作为阿里云新一代视频生成模型,Wan 3.0 不只是把视频做得更长。它将文生视频、图生视频、首尾帧生视频和参考生视频整合进一个全能模型,并支持文字、图片、视频、音频、文档和网页等多种输入。最长 30 秒生成、原生音画、1080P 输出,以及更稳定的人物、产品和场景一致性,让它更接近完整的视频生产工具,而不只是短镜头生成器。

目前,Wan 3.0 已在阿里云百炼进入公测邀测阶段,并已正式接入 Yihook。用户现在可以在 Yihook 中体验 Wan 3.0 的视频生成能力。

Wan 3.0 是什么?

Wan 3.0 是阿里云推出的全能参考视频生成模型。它使用统一入口理解创作需求,并完成不同类型的视频生成任务。

同一个模型可以支持:

  • 根据提示词生成完整视频
  • 将静态商品图或人物图转成动态视频
  • 使用首帧和尾帧控制视频起点与终点
  • 参考现有图片、视频或音频生成新内容
  • 读取 PDF、PPT、Word、表格和网页中的信息并生成视频
  • 在已有视频基础上修改画面、剧情或对白

这次升级的意义在于,创作者不再需要先判断应该选择哪个独立模型,再把不同素材拆到多个工具中处理。文字负责表达创意,图片固定人物或产品,视频提供动作和运镜,音频控制表演和节奏,文件与网页补充完整信息。模型可以在同一个上下文里理解这些素材之间的关系。

Wan 3.0 的六项核心能力

1. 原生生成最长 30 秒视频

Wan 3.0 支持单次生成最长 30 秒视频,并提供智能时长与视频延长能力。

过去,很多 AI 视频模型更适合制作 5 至 15 秒的单镜头。要完成一条稍有结构的广告,创作者通常需要反复生成多个片段,再处理人物变化、产品变形、镜头断裂和音频衔接。

30 秒单次生成给内容留下了更完整的叙事空间。一条完整的短视频可以在同一个生成任务中安排:

  • 前 3 秒:用问题、冲突或视觉动作抓住注意力
  • 中间 15 至 20 秒:展示产品、使用过程和核心卖点
  • 最后 5 秒:呈现结果、强化记忆点并完成行动引导

视频变长并不只是参数变化。它让 AI 视频从“生成一个好看的镜头”,进一步走向“完成一条有开头、发展和结尾的内容”。

2. 从多模态生成走向“任何内容都能变成视频”

Wan 3.0 支持文字、图片、视频和音频输入,还新增了文档与网页理解能力。

根据官方资料,模型可以读取 DOC、XLS、PPT、PDF、TXT、KEY、Pages、Numbers 和 Markdown 等文件,也可以使用公开网页链接作为参考。模型能够提取其中的结构和信息,再将它们组织成视频内容。

这项能力拓展了 AI 视频的起点:

现有素材 可以转化的内容方向
商品详情页 产品展示、卖点讲解、使用场景视频
产品说明书 功能教程、安装演示、注意事项视频
PPT 或营销方案 提案视频、活动预告、品牌内容
商品图片 图生视频、动态产品镜头、AI UGC 素材
参考视频 动作参考、镜头参考、节奏与风格参考
音频素材 口播表演、音乐内容、音频驱动视频

对商家和内容团队来说,这意味着现有素材不必先被手动改写成一段复杂提示词。产品资料、创意方案和历史素材都可以成为模型理解创作目标的上下文。

3. 一个模型统——多种视频生成方式

Wan 2.x 阶段,文生视频、图生视频、参考生视频和视频编辑通常对应不同的模型或调用入口。Wan 3.0 将这些能力统一进 wan3.0-video

创作者可以根据任务自由组合输入:

  • 只有创意时,从文字开始生成
  • 已有商品图时,用图片固定外观
  • 需要指定转场时,使用首尾帧控制
  • 需要复刻动作或镜头时,加入参考视频
  • 需要对白或表演时,加入音频参考
  • 需要依据完整资料创作时,加入文档或网页

这种统一能力更符合真实创作过程。商业视频往往不是纯文生视频,也不是简单图生视频,而是同时受到产品外观、品牌风格、脚本、动作、声音和投放目标的约束。

4. 原生音画生成,让声音参与视频创作

Wan 3.0 支持原生音画生成,可以在生成画面的同时处理对白、环境声、动作音效和音乐。

声音不再只是视频完成后附加的一条音轨,而是参与表演、动作和节奏设计的创作信息。官方案例展示了多语言演唱、对白口型同步、人物动作与节拍配合等场景。

这项能力尤其适合:

  • AI UGC 口播与产品推荐
  • 带对白的剧情广告
  • 音乐、舞蹈和节奏型短视频
  • 需要环境声和动作音效的产品展示
  • 带旁白的教程与讲解视频

需要注意的是,官方同时说明,当前版本的音频质感仍有提升空间。涉及品牌发布或正式投放时,仍应在导出前检查人声、口型、环境声和音乐是否符合要求。

5. 1080P 输出与更稳定的现实一致性

Wan 3.0 支持 480P、720P 和 1080P 输出。官方将“现实世界还原”和“参考一致性”列为此次升级重点。

对于更长的视频,真正困难的并不是每一帧是否漂亮,而是关键内容能否在时间中保持稳定,例如:

  • 人物的脸、发型和服装是否持续一致
  • 商品的颜色、结构、包装和 Logo 是否发生变化
  • 多个角色之间的位置和动作关系是否连贯
  • 镜头运动后,场景空间是否依然合理
  • 对白时,声音、嘴型和人物身份是否对应

Wan 3.0 重点提升了人物、道具、空间、声音和视觉风格的参考一致性。对商品视频而言,这比单纯提高分辨率更重要。商品一旦在镜头中变形,即使画面再精致,也很难进入真实的营销流程。

6. 支持视频修改、延长和剧情再创作

Wan 3.0 延续并整合了视频编辑能力,可以围绕已有结果修改画面、剧情和对白,也可以继续延长视频。

这意味着创作者不必因为一个局部问题就从头生成整条视频。例如,可以保留已经满意的人物和镜头,再调整故事发展、视觉内容或台词方向。

对商业内容来说,生成只是第一步。真正决定效率的是内容能否继续修改、复用和扩展。可编辑的视频结果更适合制作不同地区、语言、卖点和投放阶段的创意版本。

修改前 修改后

Wan 3.0 与 Wan 2.7 有什么区别?

对比维度 Wan 2.7 Wan 3.0
单次视频时长 最长 15 秒 最长 30 秒
模型入口 文生、图生、参考、编辑等不同模型 一个全能视频模型统一处理
输入类型 文字、图片、视频、音频等 增加文档与网页输入
输出分辨率 主要支持 720P、1080P 支持 480P、720P、1080P
创作重点 电影感、叙事与参考控制 更长叙事、全模态参考与现实一致性
编辑能力 通过独立视频编辑模型实现 在统一工作流中延续编辑与再创作能力

Wan 3.0 并不是简单把 Wan 2.7 的时长翻倍。它把过去分散的能力重新组织成一个统一的创作入口,并让文档、网页等信息密度更高的素材直接参与视频生成。

哪些用户适合在 Yihook 使用 Wan 3.0?

如果你正在处理以下任务,这次更新值得关注:

  • 内容创作者与视频团队,需要把文字、图片和参考素材转成更完整的视频
  • 电商团队,需要把商品信息和图片转成产品展示与营销内容
  • 广告创意团队,需要批量制作不同脚本、镜头与视觉版本
  • 品牌与市场团队,需要生成产品展示、教程、活动预告和品牌内容
  • AI UGC 创作者,需要更长、更连贯的口播或场景视频
  • 汽车、消费电子、家居、美妆、食品等需要稳定展示产品的行业团队

如果你只想精剪一条视频,专业剪辑和实拍仍然有不可替代的价值。Yihook 更适合需要持续生产、修改和复用视频内容的创作者与团队。

Wan 3.0 已正式上线 Yihook

Yihook 已完成 Wan 3.0 的接入与工作流适配,用户现在可以直接选择该模型开始创作。

Wan 3.0 不只是模型下拉菜单中的又一个选项。Yihook 围绕真实的视频创作流程组织它的能力:从创意说明、脚本和参考素材出发,完成视频生成、修改与版本拓展,让不同类型的内容团队更容易使用新模型。

模型让视频更长、更稳、可参考的信息更多;Yihook 则让这些能力进入广告、品牌、商品展示、AI UGC 和创意内容生产流程。

打开 Yihook,选择 Wan 3.0,并准备好文字脚本、高清图片、参考视频、音频或品牌素材,即可开始创作。

一个商品,多种卖法

别再猜哪条卖法有效。

带上一个商品链接,Yihook 会推演不同购买理由,并为每种卖法生成可测试的视频,让 TikTok 的数据告诉你哪条真正有效。

免费试第一条第一条 HookReel 视频可以免费试。