阿里巴巴发布 Wan 3.0:支持30秒长视频+文档直出,国产视频生成再上台阶
发布时间:2026年9月7日 | 分类:视频模型
9月4日,阿里巴巴在阿里云Model Studio平台正式发布万相系列最新一代视频生成模型 Wan 3.0。这是阿里在开源模型Wan 2.7基础上的全面升级,核心突破在于支持单次生成最长30秒连贯视频、接受多种文档格式直接转视频,以及多参考图片像一致性控制。本文基于多家媒体转述整理。
一、30秒单片段:告别"拼接焦虑"
Wan 3.0最引人注目的升级是视频时长。此前的万相2.x版本每段生成上限为15秒,制作较长内容时需要多段拼接,容易产生节奏断裂或风格不一致的问题。
Wan 3.0支持单次生成 2至30秒 的连贯视频,无需拼接。模型还配备了"Smart Duration"智能时长推荐功能——会根据你的提示词内容自动判断合适的视频长度,避免短场景被强行拉长填充。
更关键的是,视频生成时会自动同步生成配套音频,音画同步在同一个推理pass中完成。
二、文档直出视频——行业首创能力
Wan 3.0的另一个差异化特性是文档转视频能力。目前视频生成领域尚无竞品推出类似功能:
官方描述这一能力的价值为"将静态图文数据转化为现实级视频内容"。实际应用场景包括:
三、Omni-Reference多参考一致性
Wan 3.0引入了 Omni-Reference 多模态参考系统,允许在单个请求中同时传入多种参考素材:
这套系统的核心价值是跨镜头一致性——你可以用同一批参考图来控制角色长相、服装风格和场景布景,确保生成的多个视频片段属于同一个"故事世界"。
此外,Wan 3.0支持局部精修编辑:选定视频中某段时间区间,只重绘该片段,其余部分保持不变。这被行业媒体形容为从"抽奖式生成"走向"可控化生产"的关键一步。
四、规格参数与定价
截至2026年9月5日的实测数据:
平台提供两个端点:
API采用异步调用模式(提交任务 → 轮询结果),失败的视频不计费。
五、短剧创作:SceneMixer 已上线
国内短视频创作者平台 SceneMixer 已在9月5日前接入Wan 3.0,推出 "Wan 3.0 · 720P" 模式。该平台特别针对短剧场景做了优化:
据实测,Wan 3.0生成的30秒单片段足以容纳一场完整的双人对话戏,在短剧领域具有明显优势。
六、总结
Wan 3.0的发布标志着国产视频生成模型在以下几个维度实现了突破:
1. 时长突破:30秒单片段是目前的行业最高水平
2. 输入多样性:文档直出视频是独一无二的功能
3. 可控性提升:多参考+局部编辑让生成过程更像"生产"而非"抽奖"
对于需要做产品演示、教育培训、短剧内容的创作者来说,Wan 3.0是一个值得立即体验的工具。你可以在阿里云Model Studio平台或 SceneMixer 上开始尝试。
*本文基于多家媒体转述整理,信息来源包括:Yahoo Finance报道、PixMind技术指南、GPTunnel技术分析、SceneMixer应用指南及阿里云官方API文档。*
来源链接: