一条 Wan 3.0 提示词里的七个镜头:写法,以及它在哪儿会滑
没有导演模式。多镜头是一种提示词写法,不叫停的话模型自己会切,而你要的那个镜头数不是你会拿到的那个。

先说那件能替你省下一个下午的事:没有导演模式。
没有开关,没有 shots 参数,Wan 3.0 的请求里没有任何东西收一个镜头数。
有好几份排名不错的指南描述过一个带逐镜头控制的六镜头「AI 导演」功能;
打开阿里巴巴的参数表去找那个字段,
它不在那儿,因为 Wan 3.0 里的多镜头是一种提示词写法,不是一个设置。
这比听上去是更好的消息。一种写法试起来不花钱,在每一家提供方上表现一致, 而且你可以在一句话中间就改掉它。它同时也意味着没有任何东西强制执行你的镜头清单, 而这才是值得预先规划的那部分。镜头数是模型从一条提示词里读出的六层之一, 而 Wan 3.0 提示词指南讲的是另外五层。
Wan 3.0 API 文档和 创建任务参数表里 都没有镜头数参数。在相信一个说有的页面之前,这两份都值得打开看看。读于 2026-08-25。
你叫不叫它切,模型都会切
这是关于长的 Wan 3.0 生成最有用的一条事实,而几乎没有人拿它开头。
不指定分镜方式,Wan 3.0 就自己挑。在一条松散的提示词上, 它会很乐意在五秒里在两三个机位之间切;跨三十秒它会搭出一个看起来剪过的东西。 通常还挺像样。只不过那完全是它的片子,不是你的。
所以有两种活,而它们需要相反的指令:
| 你想要 | 就写 |
|---|---|
| 一段有意为之的镜头序列 | 下面那个编号写法 |
| 一条不间断的镜头,一个切都不要 | 字面上那句**「一镜到底」** |
第二行不是一条风格建议。阿里巴巴自己的指引点名了这句话, 而没有它,一个三十秒的请求就是在抛硬币赌你拿到的是一条长镜头还是一部小剪辑片。 如果你是从怎么挑长度那篇过来的, 这就是那句让「三十秒一镜到底」真的成为一镜到底的话。
那个编号写法
官方的 Wan 3.0 形状是:一行摘要,然后每个镜头带一个时间区间的编号列表, 最后一行写调性和音频。
A short piece about a baker opening up before dawn, told in seven shots.
Shot 1 [0-4s]: Wide — the shutter rolls up, street still dark, breath visible.
Shot 2 [4-9s]: Medium — she ties an apron, flour dust catching the work light.
Shot 3 [9-13s]: Close-up — dough turned out onto steel, hands pressing once.
Shot 4 [13-18s]: Medium — trays slide into the oven, door thumps shut.
Shot 5 [18-22s]: Insert — the clock hits six, light changing at the window.
Shot 6 [22-26s]: Medium — she sets a loaf in the window, straightens, exhales.
Shot 7 [26-30s]: Wide — the first customer pushes the door, bell over it.
Overall tone: warm, unhurried. Room tone, oven hum, the bell at the end.
No music.从官方示例里能提炼出四条规则:
- 时间区间必须把整个时长铺满。 空隙和重叠正是节奏出问题的地方。
- 每个镜头一个主要事件,带一个看得见的结束状态。「她系上围裙」是一个镜头。 「她准备好了」是一种气氛。
- 不要写转场。 不要「切到」,不要「然后」。模型会从镜头边界推断出一次切换, 而转场语言往往会把结构搞乱,而不是收紧它。
- 音频只在最后说一次。 Wan 3.0 会自作主张加音乐和台词,
所以
No music是一条真实的指令,而你需要它的次数会比你预想的多。
七个镜头铺开在三十秒里,平均每个 4.3 秒,那大约就是一个「读得出来」的镜头的地板。 低于三秒,你描述的就是一段蒙太奇,而模型也会把它当成蒙太奇。 如果你更愿意从一个结构而不是一个空白框开始, 提示词生成器会把一份说明铺成编号节拍。
它在哪儿会滑:镜头数是一个请求,不是一份合同
因为没有任何东西强制执行这份清单,交付回来的切换数可能和你写的那个不一样 —— 而且确实会。 有人对阿里巴巴自己发布的展示片独立数过切点,发现单个多镜头任务回来时, 镜头数大约只有提示词指定的一半。
在你规划一份七镜头的活儿之前,这一点值得内化。 这种写法给模型的是一个意图,不是一份它必须遵守的时间表。有三个后果:
- 不要把硬性要求放在第七个镜头。 如果标志必须出现, 它就不该依赖模型遵守你最后那个时间区间。
- 判断内容之前,先数结果里的切换数。 一段「感觉太赶」的序列, 通常是一段把你两个镜头合并了的序列。
- 你要的镜头越多,这个数漂得越厉害。 三十秒里四到五个镜头, 比七个可靠得多;而七个又比每两秒一个可靠。
让一个角色跨过这些切换保持稳定
一条连续镜头内部的一致性,主要是 Wan 3.0 的问题。跨过切换之后它就成了你的, 而失败方式很具体:脸通常保得住,而配饰会乱走。 在阿里巴巴自己的演示素材里,有人发现一条帽带和一枚项链吊坠都在变,而那张脸是稳的 —— 这还是在一条不间断的镜头内部,都不是跨切换。
有三个管用的习惯,按它们能买到多少排序:
每个镜头只改一个变量。 大多数关于一致性的抱怨, 背后是一条在同一个边界上同时挪了场地、机位和布光的提示词。模型没有任何东西可以抓住。 挪一样,其余保持住。
在每一个镜头描述里把整套服装重述一遍。 这感觉很啰嗦, 而它是整条提示词里价值最高的那份啰嗦。第五个镜头里的「她」, 和第五个镜头里「她,白 T 恤外面套着灰围裙,头发扎起来」不是同一条指令。
按名字绑定你的参考素材,并且反复用那个名字。 Wan 3.0 收 10 张参考图、5 段参考画面和 5 段参考音频, 在提示词里以「Image 1」「Video 2」这样点名,图和视频各自分开计数。 在开头绑定一次 —— Image 1 定义这位面包师;只从 Image 2 取那条围裙 —— 然后引用这个绑定,而不是把这个人再描述一遍。
有一条经济上的注意事项塑造着你怎么组织这一切: 参考图不额外收钱,参考画面的秒数按你的输出档单价计费。 十张静帧免费;一段十五秒的参考片段是这份菜单上最贵的输入。 要保住身份和服装,请用静帧。
这套绑定有三个做好的版本,每一个都印着完整提示词和它需要的编号: 四个动作节拍硬塞进五秒, 那主要是一堂关于「装不下什么」的课; 一次交接,写成段落式节拍,带一整句保持约束; 以及一张几乎静止的人像,它握住一张参考图,只让蝴蝶在动。
风格:3D 和卡通撑得住,只要你把它一次立法立好
风格化的观感 —— 3D 动画、赛璐璐卡通、黏土定格 —— 跨过一段多镜头 Wan 3.0 序列时, 撑得和写实差不多好;而它们失败时的失败方式也一样:在一个改动过多的镜头边界上漂移。
技巧是把风格放进全局规则里,写在镜头清单上方,而不是每个镜头重复一遍:
Style: 3D animation, soft rounded forms, matte surfaces, no photoreal skin
texture. Palette: warm ochre, cream, one accent of teal. Key light always
from frame left. Do not change render style between shots.有两样东西对得起放在那儿的位置。一套点了名的配色远比「暖色调」稳定, 因为模型能在七个镜头里握住三个具名的值,握不住一个形容词。 而一条明确的禁令 —— 不要在镜头之间改变渲染风格 —— 值得写出来; 排除项那一层正是官方长篇示例里最激进的地方,而风格漂移正是它存在要防的东西。
什么时候该把这份活拆开
有时候正确答案不是一条更好的提示词。如果这段序列里有一个硬性交付物 —— 一件必须正确的产品、一个必须落下的标志、一句必须说出来的台词 —— 那上面那个镜头数漂移就让「一次七镜头生成」成为错的工具。
管用的替代方案:
- 用一张静帧把观感一次锁定。
- 从那张静帧出发,每个镜头做一张首帧图,每次只改一样。
- 每个镜头各自生成,带上绑定好的参考素材。
- 在本地拼接。
它要花更多次生成,而它给你一个你自己选的镜头数。 当画面里有什么东西不可谈判时,这么做值得;做一条气氛片就是杀鸡用牛刀。
而如果只有一个镜头里的一个细节不对,不要重新生成那个镜头。 Wan 3.0 能在原片上就地修改 —— 换掉那个道具,保住动作、服装和画面其余部分 —— 那只是把整整三十秒重新抛一次骰子的一小部分成本。
关于多镜头,参数表并不支持的四个说法
| 在流传的说法 | 文档实际怎么写 |
|---|---|
| 一个带逐镜头参数的「AI 导演」模式 | 不存在这样的字段。多镜头是提示词写法 |
| 一个硬性的六镜头上限 | 不存在镜头参数,所以没有东西可以设上限。限制你的是三十秒和可读性 |
| 跨会话的角色记忆,被包装成「Identity Lock」 | 不存在这样的字段,而且 Wan 3.0 在两次任务之间什么都不留。一致性来自你每一次都自己提供的参考绑定 |
| 十二门语言的音素级对口型 | 不是一项有文档的能力。Wan 3.0 会和画面一起生成语音;没有公布过语言数 |
如果一份指南描述了一个你在请求里表达不出来的功能,那它不是照着文档写的。 这个筛子的用处远远超出这一个模型。
一份七镜头检查清单
- 先摘要行,再编号镜头,最后调性和音频。
- 时间区间把整个时长铺满,不留空隙。
- 每个镜头一个主要事件、一个结束状态。
- 镜头之间不写转场词。
- 风格、配色和禁令放在清单上方的全局块里。
- 每一个出现该角色的镜头里都重述服装。
- 最后一个镜头里不放任何承重的东西。
常见问题
Wan 3.0 有多镜头或者导演模式吗?
没有。API 里没有镜头参数,也没有可以打开的模式。你是靠在提示词里写带时间区间的编号镜头 来得到多个镜头的,这也意味着它在每一家提供方上的工作方式都一样。
一次生成能有几个镜头?
没有有文档的上限,因为没有可以设上限的设置。三十秒才是真正的约束 —— 在 Wan 3.0 上四到五个镜头最能撑得住,而七个在每个约四秒时是可行的。 要得更多,模型就开始把它们合并。
我怎么让 Wan 3.0 不要切?
写「一镜到底」。不指定的话,模型会自己挑分镜方式,而且通常会切,哪怕在短片子上。
我的角色为什么在镜头之间变了?
几乎总是因为某一个镜头边界上同时改了好几样东西。每个镜头只挪一个变量, 每一次都把服装完整重述一遍,并且绑定一张身份参考图,而不是把这个人再描述一遍。 特别盯着配饰 —— 帽子、首饰和道具,比脸早得多就开始漂。
3D 或者卡通风格和写实一样管用吗?
一样,而且 Wan 3.0 跨切换保持一个风格化观感的能力,和它保持一个写实观感差不多。 请把风格、一套点了名的配色,以及一条明确的「不要在镜头之间改变渲染风格」 放进镜头清单上方的全局块里,而不是一个镜头一个镜头地重复。
作者
wan-3.run
独立的 Wan 3.0 界面


