Wan 3.0
通义万相新一代全能视频生成模型,已接入 a2e。单段原生 30 秒直出, 文生、图生、首尾帧、参考生四种模式一站搞定,最高支持 20 个素材参考, 文档与网页也能直接变成视频。
用这个模型做出来的东西
以下片段全部出自万相官方演示,用来判断画面能到什么水准。
核心能力
以下五条与其中的数字均取自万相官方说明,配图片段也出自官方演示;在 a2e 上的实际表现以你生成的结果为准。
全能创作:一次最多喂 20 个素材
最高支持 20 个素材参考生成,并且支持复杂文档和网页解析——doc、xls、ppt、pdf、md 都能直接作为参考输入。这意味着一份产品文档、一页竞品网页,可以不经改写就变成视频的内容来源。
原生 30 秒,不是拼出来的
单段原生 30 秒直出,叙事能力更完整、创作自由度更大,另有智能时长功能可按提示词自动推荐合适长度。一条里就装得下完整的情绪起伏与剧情推进,连续运镜、一镜到底这类镜头语言才有空间展开。
像素级一致性,面向交付而不是试玩
精准还原和复刻参考细节,面向生产力场景提升交付确定性。角色、道具、声音、空间关系、风格这些细粒度维度都能稳定保持——同一个人物跨镜头不会走样,这正是能不能拿去交付的分水岭。
画面与声音一起做
真实感、画面质感、音效全面提升,创造更强的视听冲击力。生成时可以直接开启「生成音频」,画面与声音一次出——不用先出片再配音,也就少一道对轨的活。
精准视频编辑,改一处不重出整段
视频编辑更加精准,支持指令编辑与参考编辑两种方式,提升创作效率。想改画面、剧情还是台词,说清楚要改哪里即可,不必把整段重新生成一遍。
先选模式,再谈参数
a2e 上的 Wan 3.0 开放了四种模式。选哪种,决定了你要准备什么素材、以及哪些参数会被素材锁死。
文生视频
只写提示词,不上传任何素材。描述场景、人物动作、镜头运动与氛围,模型直接出片。适合从零起稿、快速试路子。
图生视频(首帧生成)
上传一张图片作为视频首帧,AI 根据提示词生成后续画面。支持上传音频以生成带声音的视频。手上已有一张定妆图、一张产品图时,这是最省事的一条路。
首尾帧生视频
分别上传首帧和尾帧图片,AI 会自动补全从首帧到尾帧的过渡动画,可通过交换按钮快速切换首尾帧。表情变化、姿态变换、场景转换这类需要精确控制起止画面的镜头,用它最稳。
参考生视频
可上传多张参考图片、视频或音频,也可提供文档/网页参考,Wan 3.0 会结合这些素材引导生成。参考视频总时长需控制在 15 秒内,系统会调整输出时长,使输入与输出合计不超过 30 秒。
三步就能出第一条
下面是 a2e 上的实际操作顺序,不需要额外开通任何东西。
选择任务类型
用单张图片、首尾帧,还是多模态参考素材来引导视频生成,先定下来。四种模式的差别见上一节。
上传素材与编写提示词
根据所选模式上传对应素材,包括图片、视频、音频,或文档/网页参考,并描述想要的动作、镜头运动和氛围。提示词上限 5000 字符,写得越具体越好。
配置参数并生成
选择视频时长、分辨率等参数,点击「生成视频」开始创作。结果会进「我的结果」,可以继续拿去做超分辨、去字幕等后处理。
能调什么
以下是 a2e 上 Wan 3.0 实际开放的参数,用来判断它够不够你的交付要求。
时长与分辨率
时长:3 秒 / 5 秒 / 10 秒 / 15 秒 / 30 秒,默认 5 秒。参考生视频模式会根据上传的参考视频时长动态调整可选范围。
分辨率:480P / 720P / 1080P。分辨率越高画质越清晰,所需点数也越多——先用低分辨率试路子、定稿再出高清,是最省的用法。
输入素材的限制
图片:jpg / png,单张不超过 20MB,宽度和高度均需在 240–7680 像素之间。
提示词:上限 5000 字符。另有负面提示词用来排除不想要的东西(如「模糊、低质量、畸形」),以及提示词扩展——开启后 AI 会自动扩展和丰富你的描述。
其他开关
生成音频:默认开启,可关。生成数量:一次可出多条。随机种子:仅限 Ultra 用户,用来复现同一个结果。
四条能少走弯路的经验
选择高质量素材
使用高清、构图清晰的图片或视频能获得更好的效果,避免模糊或低分辨率的素材。输入的质量上限就是输出的质量上限,这一条比调参数管用。
描述具体动作
提示词中包含具体的动作描述,如「缓慢行走」「轻轻点头」,能获得更精准的效果。笼统的形容词(「很有感觉」)模型接不住。
善用首尾帧模式
首尾帧模式非常适合制作表情变化、姿态变换、场景转换等需要精确控制起止画面的视频。知道要从哪儿到哪儿的时候,别用文生视频去碰运气。
规划参考时长
参考生成视频时,参考视频总时长需控制在 15 秒内;系统会调整输出时长,使输入与输出合计不超过 30 秒。参考素材越长,能留给输出的就越短,动手前先算这笔账。
文档与入口
要做集成看开发者文档,想直接用就从下面进。