Wan 3.0 参考生视频
把脸、外套、产品、声音都传上来 —— Wan 3.0 四样全收,并在一个从未存在过的场景里,把每一样都保持三十秒不变。一次生成里最多十张图、五段视频和五段音频。
三条已发布的 Wan 3.0 生成,后面是站上其余全部想法 · 点「试这条」会把提示词装进来
16:9 · 720P · 5 秒点名 Image 1,并把它锁住
Wan 3.0 参考生视频
把什么保持不变
你上传素材,Wan 3.0 搭一个服从这些素材的场景。
Wan 3.0 参考生视频能收最多二十份参考素材 —— 十张图、五段视频和五段音频 —— 并且把每一份当作一条约束,而不是一个起点。这些脸、衣服、道具、声音和空间关系,会在一条最长三十秒的镜头里全程保持一致,音频在同一次生成里产出。
- 图 · 视频 · 音频
- 10 + 5 + 5
- 一个请求里的素材份数
- 20
- 任意整秒
- 2–30 秒
- 30 fps,含声音
- 480P / 720P / 1080P
图 · 视频 · 音频
一个请求里的素材份数
任意整秒
30 fps,含声音
- 不是剪辑器 —— 它搭的是一个新场景,不是改一个旧的
- 不是换脸,也不是一条在别人不同意的情况下把人放进视频的路
- 参考素材旁边不能有首帧 —— 这两族互相排斥
为什么 Wan 3.0 不肯同时收参考素材和首帧
Wan 3.0 有两族媒体输入,而一个请求只能用其中一族。
reference_image参考族本页reference_image·reference_video·reference_audio·file·link—— 模型从中借用、用来搭一个从未存在过的场景的素材。
first_frame帧族图生视频first_frame·last_frame—— 一个确切的开场,以及可选的一个确切的结尾,产出必须从中经过。
Wan 3.0 能收
多少份参考素材
三类素材进 Wan 3.0,各有各的上限:十张图、五段视频、五段音频。
⚠️ Wan 3.0 把参考画面的秒数和你的输出秒数一起计费,而两者相加不能超过三十。 六秒参考加二十秒输出是二十六个计费秒,是一个合法请求;六加二十八不是。图片、音频、文档和链接都不加钱。
五个视频位每个十五秒就是七十五秒,而上限是十五 —— 所以在视频上,位数从来不是那个卡住你的约束,累计时长才是。提示词框上方那个计数器在你按下生成之前,会把两者都按秒数和积分数盯着。
Wan 3.0 实际稳住的是什么
阿里巴巴列了 Wan 3.0 一致性的四个维度。分开知道它们是值得的,因为当有什么东西漂移时,通常是其中一个,不是四个一起。
主体
镜头对着的那样东西。
characters角色
面部特征、发型与发色、体型、服装、配饰。
细到一件夹克的带子能挺过一场打戏。
props道具
多角度外观、结构件、标志、材质细节。
同一个瓶子,镜头换了标签还在。
场景
主体周围的一切。
space空间
角色调度与镜头视角,空间关系保持正确。
地理关系不再在镜头之间漂移。
style风格
影像调性稳定呈现,多风格项目里各种观感之间不串。
整组片子一个调子。
阿里巴巴自己的 Wan 3.0 展示片,用两张参考图跑过三十秒的高速动作,全程保住了毛发、服装、刀鞘和站位。那是上限;你的结果主要取决于参考素材的质量。
大多数真实的活儿不是一条长镜头 —— 是三四条必须看起来像同一次拍摄的片子,而做到这件事的办法比听上去无聊:除了提示词,其余一切都保持不变。同样的文件,逐字节相同;每一份素材同样的活;结尾同样那句风格;同样的分辨率和比例。只改动作和镜头。重新上传一份轻微重导出过的同一张照片,是一组片子发生漂移最常见的原因,因为那个文件已经不是同一个了 —— Wan 3.0 在两次请求之间没有记忆,所以一致性完全取决于你交给它什么。
给每一份 Wan 3.0 参考素材派一个活
这一部分决定结果看起来对不对,也是大多数 Wan 3.0 尝试出问题的地方。模型不会去猜你上传一个文件是为了什么 —— 你要在提示词里按编号告诉它。
锁住一张脸和一身衣服Wan 3.0 做得最强的一件事。一张图一个人,正面、打光好,每一次都胜过有艺术感 —— 一张证件照式的照片比一张情绪化的人像管用。
Image 1 是那位穿灰色羊毛大衣的女子;请精确保住她的脸、头发和大衣。
锁住一件产品或道具多角度外观、标志、结构件和材质都能保住。同一个物件的两个角度,比一张主视图管用。
Image 2 和 Image 3 是同一个瓶子;请保住标签和瓶盖结构。
贡献运动和节奏一段参考片段不是拿来被复制的 —— 它是拿来贡献它的节奏的:一个节拍持续多久,一次转场怎么走。
Video 1 只贡献走路的步频,不贡献角色。
贡献一个声音,或者定下空间一份音频参考定下音色,而与一份人脸参考配对时,对口型会跟着它。一张场地板图会把调度和镜头视角固定住,于是地理关系不再漂移。
Audio 1 只贡献音色。Image 4 定下房间和机位高度。
写 Image 1,不要写 image1
Image 1 · Video 1 · Audio 1Wan 3.0@image1Seedance
Wan 3.0 要的是首字母大写、中间带空格的英文写法。@image1 是 Seedance 的语法,好几份指南把它照抄到这里,而在这里它不会被读。编号在每一类媒体内部各自排,按上传顺序 —— 把文件重新排一次序,你发出的就是另一个请求了。
二十份素材是那个招牌数字;你实际该用的数字要小得多。一张图一个主体,一份素材一个活 —— 一旦一个文件同时背着两个互相冲突的活,或者一张图里有两个人,模型就只能猜,而猜正是你上传参考素材要防的那件事。好场景大多三四份就做完了。剩下的提示词不想自己写?提示词生成器会按阿里巴巴的顺序替你写。
Wan 3.0 的一致性什么时候会崩,以及怎么办
参考模式是 Wan 3.0 里唯一一条你的输入也要计费的路,所以一次回来是错的生成要花两份钱。下面是它出错的五种方式,按你大概率会遇到的顺序排 —— 而生成按钮上方那块面板,会替你读出它能预先看见的那几种。
角色长得不像参考
几乎总是因为那张图里不止一个人,或者因为同一张图还被要求去定义场地或风格。
一张图一个主体,一份素材一个活。
两个角色在接触的地方糊在一起
位置重叠加上同时动作,是最难的情况。先在一个分得很开的镜头上验证,再加上接触。
两个分得很开的角色是靠得住的;一群互相挨着的人不是。
运动没有理会那段参考片段
那份素材同时还被要求去定义一个角色,所以它背着两个活,模型只能选一个。
把它拆成两份素材,各背一个活。
账单比预想的大
参考画面的秒数按你的输出档单价计费,而且它们算进同一个三十秒上限。图片、音频、文档和链接不要钱。
6 秒参考 + 20 秒输出 = 26 个计费秒。
请求在生成之前就被拒了
参考素材旁边发了一个首帧。这两族互相排斥,而被拒的是整个请求,不是其中一个输入。
顺序:Image 1 · Image 2 · Video 1 —— 没有帧输入。
先从简单的开始,把参考素材的质量验证掉,再加复杂度。一个五个角色会失败的场景,两个角色往往就成了,而两条干净的片子剪在一起,胜过一条糊掉的。
一条 Wan 3.0 参考生视频的片子要多少钱
和其他每一种模式同样的每秒单价 —— 参考素材本身不加价。唯一的例外是参考画面:它的秒数按和你输出一样的单价计费。 图片、音频、文档和链接都不加钱。和别处一样,失败的生成会自动退回,所以一次坏生成让你付出的只有等待。
这一项怎么计费
- 计费单位
- 输出秒
- 参考图 · 音频 · 文档 · 链接
- free
- 参考画面
- 按你的输出档单价计费
- 失败的生成
- refunded
- 参考图 · 音频 · 文档 · 链接
- 不加价
参考画面是这一页有、而别的工具没有的第三个变量:一段 15 秒的参考片段配一条 15 秒的产出,是三十个计费秒,不是十五个。先在 480P 打草稿,再让留下来的那条跑一次。完整价目表
两种付法,每月积分一样
使用一个真人的肖像
Wan 3.0 参考生视频能在整条镜头里保住一张脸。这是它的能力,也正是它让滥用变容易的地方,所以这里的规则很短:只有在对方同意的情况下,才上传他的肖像。
- 人脸拍一个真人的视频需要他本人同意 —— 公众人物不算,陌生人的照片也不算。
- 声音一份音色参考会克隆某一个具体的人听起来什么样。请用你自己的、获得授权的,或者合成的。
- 角色形象一个受版权保护的角色,不会因为被模型重新生成一遍就变成你的。
- 未成年人永远不要上传描绘未成年人的参考素材。
- 审核提交的媒体会被自动筛查,举报会进一个有人盯着的收件箱,下架是尽快处理而不是慢慢处理。误报和漏报都会发生。
Wan 3.0 参考生视频常见问题
Wan 3.0 参考生视频在一条镜头里稳住什么,以及参考秒数会往账单上加多少
试 Wan 3.0 参考生视频要注册吗?
Wan 3.0 能收多少张参考图?
我能同时用 Wan 3.0 的参考图和首帧吗?
为什么我的角色跟 Wan 3.0 的参考长得不一样?
参考画面会让一条 Wan 3.0 的片子更贵吗?
Wan 3.0 能像保住一张脸那样保住一个声音吗?
一个 Wan 3.0 镜头里能有几个角色?
参考素材会跨多次 Wan 3.0 生成带过去吗?
Wan 3.0 的参考素材接受哪些格式?
这些视频能商用吗?
给你的第一个 Wan 3.0 场景选角
传一张脸,给它一个活,再把镜头描述出来。Wan 3.0 参考生视频按积分跑,从 480P 起 —— 你的素材不加价,失败的生成会自动退回。
由 wan-3.run 编辑团队撰写与维护发布于 最后更新 工具 版本 2026.09.4
