Wan 3.0 已正式上线 Yihook。
作为阿里云新一代视频生成模型,Wan 3.0 不只是把视频做得更长。它将文生视频、图生视频、首尾帧生视频和参考生视频整合进一个全能模型,并支持文字、图片、视频、音频、文档和网页等多种输入。最长 30 秒生成、原生音画、1080P 输出,以及更稳定的人物、产品和场景一致性,让它更接近完整的视频生产工具,而不只是短镜头生成器。
目前,Wan 3.0 已在阿里云百炼进入公测邀测阶段,并已正式接入 Yihook。用户现在可以在 Yihook 中体验 Wan 3.0 的视频生成能力。
Wan 3.0 是什么?
Wan 3.0 是阿里云推出的全能参考视频生成模型。它使用统一入口理解创作需求,并完成不同类型的视频生成任务。
同一个模型可以支持:
- 根据提示词生成完整视频
- 将静态商品图或人物图转成动态视频
- 使用首帧和尾帧控制视频起点与终点
- 参考现有图片、视频或音频生成新内容
- 读取 PDF、PPT、Word、表格和网页中的信息并生成视频
- 在已有视频基础上修改画面、剧情或对白
这次升级的意义在于,创作者不再需要先判断应该选择哪个独立模型,再把不同素材拆到多个工具中处理。文字负责表达创意,图片固定人物或产品,视频提供动作和运镜,音频控制表演和节奏,文件与网页补充完整信息。模型可以在同一个上下文里理解这些素材之间的关系。
Wan 3.0 的六项核心能力
1. 原生生成最长 30 秒视频
Wan 3.0 支持单次生成最长 30 秒视频,并提供智能时长与视频延长能力。
过去,很多 AI 视频模型更适合制作 5 至 15 秒的单镜头。要完成一条稍有结构的广告,创作者通常需要反复生成多个片段,再处理人物变化、产品变形、镜头断裂和音频衔接。
30 秒单次生成给内容留下了更完整的叙事空间。一条完整的短视频可以在同一个生成任务中安排:
- 前 3 秒:用问题、冲突或视觉动作抓住注意力
- 中间 15 至 20 秒:展示产品、使用过程和核心卖点
- 最后 5 秒:呈现结果、强化记忆点并完成行动引导
视频变长并不只是参数变化。它让 AI 视频从“生成一个好看的镜头”,进一步走向“完成一条有开头、发展和结尾的内容”。
2. 从多模态生成走向“任何内容都能变成视频”
Wan 3.0 支持文字、图片、视频和音频输入,还新增了文档与网页理解能力。
根据官方资料,模型可以读取 DOC、XLS、PPT、PDF、TXT、KEY、Pages、Numbers 和 Markdown 等文件,也可以使用公开网页链接作为参考。模型能够提取其中的结构和信息,再将它们组织成视频内容。
这项能力拓展了 AI 视频的起点:
| 现有素材 | 可以转化的内容方向 |
|---|---|
| 商品详情页 | 产品展示、卖点讲解、使用场景视频 |
| 产品说明书 | 功能教程、安装演示、注意事项视频 |
| PPT 或营销方案 | 提案视频、活动预告、品牌内容 |
| 商品图片 | 图生视频、动态产品镜头、AI UGC 素材 |
| 参考视频 | 动作参考、镜头参考、节奏与风格参考 |
| 音频素材 | 口播表演、音乐内容、音频驱动视频 |
对商家和内容团队来说,这意味着现有素材不必先被手动改写成一段复杂提示词。产品资料、创意方案和历史素材都可以成为模型理解创作目标的上下文。
3. 一个模型统——多种视频生成方式
Wan 2.x 阶段,文生视频、图生视频、参考生视频和视频编辑通常对应不同的模型或调用入口。Wan 3.0 将这些能力统一进 wan3.0-video。
创作者可以根据任务自由组合输入:
- 只有创意时,从文字开始生成
- 已有商品图时,用图片固定外观
- 需要指定转场时,使用首尾帧控制
- 需要复刻动作或镜头时,加入参考视频
- 需要对白或表演时,加入音频参考
- 需要依据完整资料创作时,加入文档或网页
这种统一能力更符合真实创作过程。商业视频往往不是纯文生视频,也不是简单图生视频,而是同时受到产品外观、品牌风格、脚本、动作、声音和投放目标的约束。
4. 原生音画生成,让声音参与视频创作
Wan 3.0 支持原生音画生成,可以在生成画面的同时处理对白、环境声、动作音效和音乐。
声音不再只是视频完成后附加的一条音轨,而是参与表演、动作和节奏设计的创作信息。官方案例展示了多语言演唱、对白口型同步、人物动作与节拍配合等场景。
这项能力尤其适合:
- AI UGC 口播与产品推荐
- 带对白的剧情广告
- 音乐、舞蹈和节奏型短视频
- 需要环境声和动作音效的产品展示
- 带旁白的教程与讲解视频
需要注意的是,官方同时说明,当前版本的音频质感仍有提升空间。涉及品牌发布或正式投放时,仍应在导出前检查人声、口型、环境声和音乐是否符合要求。
5. 1080P 输出与更稳定的现实一致性
Wan 3.0 支持 480P、720P 和 1080P 输出。官方将“现实世界还原”和“参考一致性”列为此次升级重点。
对于更长的视频,真正困难的并不是每一帧是否漂亮,而是关键内容能否在时间中保持稳定,例如:
- 人物的脸、发型和服装是否持续一致
- 商品的颜色、结构、包装和 Logo 是否发生变化
- 多个角色之间的位置和动作关系是否连贯
- 镜头运动后,场景空间是否依然合理
- 对白时,声音、嘴型和人物身份是否对应
Wan 3.0 重点提升了人物、道具、空间、声音和视觉风格的参考一致性。对商品视频而言,这比单纯提高分辨率更重要。商品一旦在镜头中变形,即使画面再精致,也很难进入真实的营销流程。
6. 支持视频修改、延长和剧情再创作
Wan 3.0 延续并整合了视频编辑能力,可以围绕已有结果修改画面、剧情和对白,也可以继续延长视频。
这意味着创作者不必因为一个局部问题就从头生成整条视频。例如,可以保留已经满意的人物和镜头,再调整故事发展、视觉内容或台词方向。
对商业内容来说,生成只是第一步。真正决定效率的是内容能否继续修改、复用和扩展。可编辑的视频结果更适合制作不同地区、语言、卖点和投放阶段的创意版本。
| 修改前 | 修改后 |
|---|---|
Wan 3.0 与 Wan 2.7 有什么区别?
| 对比维度 | Wan 2.7 | Wan 3.0 |
|---|---|---|
| 单次视频时长 | 最长 15 秒 | 最长 30 秒 |
| 模型入口 | 文生、图生、参考、编辑等不同模型 | 一个全能视频模型统一处理 |
| 输入类型 | 文字、图片、视频、音频等 | 增加文档与网页输入 |
| 输出分辨率 | 主要支持 720P、1080P | 支持 480P、720P、1080P |
| 创作重点 | 电影感、叙事与参考控制 | 更长叙事、全模态参考与现实一致性 |
| 编辑能力 | 通过独立视频编辑模型实现 | 在统一工作流中延续编辑与再创作能力 |
Wan 3.0 并不是简单把 Wan 2.7 的时长翻倍。它把过去分散的能力重新组织成一个统一的创作入口,并让文档、网页等信息密度更高的素材直接参与视频生成。
哪些用户适合在 Yihook 使用 Wan 3.0?
如果你正在处理以下任务,这次更新值得关注:
- 内容创作者与视频团队,需要把文字、图片和参考素材转成更完整的视频
- 电商团队,需要把商品信息和图片转成产品展示与营销内容
- 广告创意团队,需要批量制作不同脚本、镜头与视觉版本
- 品牌与市场团队,需要生成产品展示、教程、活动预告和品牌内容
- AI UGC 创作者,需要更长、更连贯的口播或场景视频
- 汽车、消费电子、家居、美妆、食品等需要稳定展示产品的行业团队
如果你只想精剪一条视频,专业剪辑和实拍仍然有不可替代的价值。Yihook 更适合需要持续生产、修改和复用视频内容的创作者与团队。
Wan 3.0 已正式上线 Yihook
Yihook 已完成 Wan 3.0 的接入与工作流适配,用户现在可以直接选择该模型开始创作。
Wan 3.0 不只是模型下拉菜单中的又一个选项。Yihook 围绕真实的视频创作流程组织它的能力:从创意说明、脚本和参考素材出发,完成视频生成、修改与版本拓展,让不同类型的内容团队更容易使用新模型。
模型让视频更长、更稳、可参考的信息更多;Yihook 则让这些能力进入广告、品牌、商品展示、AI UGC 和创意内容生产流程。
打开 Yihook,选择 Wan 3.0,并准备好文字脚本、高清图片、参考视频、音频或品牌素材,即可开始创作。
一个商品,多种卖法
别再猜哪条卖法有效。
带上一个商品链接,Yihook 会推演不同购买理由,并为每种卖法生成可测试的视频,让 TikTok 的数据告诉你哪条真正有效。
