一段 Wan 3.0 提示詞七顆鏡頭:格式,以及它會在哪裡鬆掉
沒有導演模式。多鏡頭是一種提示詞格式,不叫它別切它就會自己切,而你要的鏡頭數不是你拿到的那個。

先講那件能替你省下一個下午的事:沒有導演模式。 沒有開關、沒有 shots 參數,
Wan 3.0 的請求裡沒有任何東西收鏡頭數。有好幾份排名不錯的指南描述了一個六鏡頭的
「AI 導演」功能、還帶逐鏡頭控制;打開
阿里巴巴的參數表
去找那個欄位,它不在那裡,因為 Wan 3.0 的多鏡頭是一種提示詞格式,不是一個設定。
這是比聽起來更好的消息。一個格式試起來不用錢、在每一家供應商上運作方式完全相同, 而且你可以寫到一半就改。它同時也意味著:沒有任何東西會強制執行你的分鏡表,而那正 是值得先規劃的部分。鏡頭數是模型從一段提示詞裡讀出的六層之一,而 Wan 3.0 提示詞指南講的是另外五層。
Wan 3.0 API 文件 和建立任務的 schema 裡都沒有鏡頭數這個參數。在相信一個說法相反的頁面之前,這兩份都值得先打開。 2026-08-25 讀取。
你叫不叫,它都會切
這是關於 Wan 3.0 長生成最有用的一個事實,而幾乎沒有人拿它當開頭。
不指定鏡頭覆蓋,Wan 3.0 會自己挑。一段鬆散的提示詞下,它會很樂意在五秒之內在兩三 個機位之間切;而在三十秒的跨度上,它會蓋出一個看起來剪過的東西。通常剪得還不錯。 但那完全是它的片子,不是你的。
所以這是兩份工作,而它們需要相反的指示:
| 你要的是 | 就寫 |
|---|---|
| 一段刻意安排的鏡頭序列 | 下面那個編號格式 |
| 一顆不中斷的鏡頭,完全不要切 | 照字面寫 「one continuous take」 |
第二列不是一個風格建議。阿里巴巴自己的指引就點名了這個說法,而沒有它的話,一個三 十秒的請求,你拿到長鏡頭還是一部小型剪接片,是擲硬幣。如果你是從 怎麼挑長度那一篇過來的,這就是讓那個三十秒一次過真的 變成一顆鏡頭的那一句。
編號格式
官方的 Wan 3.0 形狀是:一行摘要,然後編號鏡頭、每一顆帶一個時間區間,最後一行寫語 氣和聲音。
A short piece about a baker opening up before dawn, told in seven shots.
Shot 1 [0-4s]: Wide — the shutter rolls up, street still dark, breath visible.
Shot 2 [4-9s]: Medium — she ties an apron, flour dust catching the work light.
Shot 3 [9-13s]: Close-up — dough turned out onto steel, hands pressing once.
Shot 4 [13-18s]: Medium — trays slide into the oven, door thumps shut.
Shot 5 [18-22s]: Insert — the clock hits six, light changing at the window.
Shot 6 [22-26s]: Medium — she sets a loaf in the window, straightens, exhales.
Shot 7 [26-30s]: Wide — the first customer pushes the door, bell over it.
Overall tone: warm, unhurried. Room tone, oven hum, the bell at the end.
No music.從官方範例裡歸納出來的四條規則:
- 時間區間必須鋪滿整個長度。 空隙和重疊,正是節奏出問題的地方。
- 每顆鏡頭一個主要事件,並且有一個看得見的結束狀態。「她繫上圍裙」是一顆鏡頭。 「她準備出門」是一種氛圍。
- 不要寫轉場。 不要「cut to」、不要「then」。模型會從鏡頭邊界推斷出一個切點, 而轉場語言傾向於把結構弄糊,而不是弄緊。
- 聲音只在最後講一次。 Wan 3.0 會自作主張加配樂和口說台詞,所以
No music是一條真的指令,而你會比預期更常需要它。
七顆鏡頭分在三十秒裡,平均每顆 4.3 秒,那大約就是一顆讀得出來的鏡頭的地板。低於三 秒,你描述的是一段蒙太奇,而模型也會把它當成蒙太奇處理。如果你寧願從一個結構開始 而不是從一個空白框開始,提示詞產生器會把一份 brief 排成編號 節拍。
它在哪裡鬆掉:鏡頭數是一個請求,不是一份合約
因為沒有任何東西強制執行那張清單,交回來的切點數量可能和你寫的不一樣 —— 而它確實 不一樣。有人對阿里巴巴自己公開的展示片獨立數過切點,發現單一的多鏡頭任務回來時, 鏡頭數大約只有提示詞指定的一半。
在你規劃一份七鏡頭的 brief 之前,這件事值得先內化。這個格式給模型的是一個意圖,不 是一條它必須遵守的時間軸。三個後果:
- 不要把硬性需求放在第七顆鏡頭。 如果標誌非出現不可,它不該取決於模型有沒有遵 守你最後那個時間區間。
- 在評論內容之前,先數結果裡的切點。 一段「感覺很趕」的序列,通常是一段把你兩 顆鏡頭併成一顆的序列。
- 你要的鏡頭越多,數量飄得越厲害。 三十秒裡四到五顆鏡頭,可靠度遠高於七顆,而 七顆又高於每兩秒一顆。
讓一個角色跨過切點保持穩定
在一顆連續鏡頭內部,一致性主要是 Wan 3.0 的問題。跨過切點,它就變成你的問題,而失 敗的方式很具體:臉通常守得住,飄掉的是配件。 在阿里巴巴自己的示範影片裡,有人 發現一條帽帶和一個項鍊墜子都變了,而臉是穩的 —— 而且那還是在一顆沒中斷的鏡頭內部, 根本還沒跨過切點。
三個有用的習慣,按它們替你換到多少排序:
每顆鏡頭只改一個變數。 多數關於一致性的抱怨,來自一段在同一個邊界上同時換了地 點、機位和光線的提示詞。模型沒有東西可以抓。動一樣,其他不動。
在每一顆鏡頭的描述裡把整套服裝重講一遍。 這感覺很囉唆,而它是整段提示詞裡價值 最高的囉唆。第五顆鏡頭裡的「她」,和第五顆鏡頭裡的「她,白 T 外面罩著灰圍裙,頭髮 綁起來」,不是同一條指令。
把你的參考用名字綁定,然後重複用那個名字。 Wan 3.0 收 10 張參考圖、5 段參考用影片和 5 段參考音訊,在提示詞裡用「Image 1」「Video 2」這樣 稱呼,而圖片和影片是分開計數的。在最上面綁定一次 —— Image 1 定義這位烘焙師;只從 Image 2 取圍裙 —— 然後就去指涉那個綁定,不要再重新描述那個人。
有一個經濟上的注意事項會影響你怎麼組合這一切:參考圖不另外收錢,參考用影片的秒 數會按你的輸出費率計費。 十張靜圖是免費的;一段十五秒的參考用影片是整份菜單上最貴 的輸入。要做身分和服裝,用靜圖。
那個綁定有三個實作過的版本,每一個都印出完整的提示詞和它需要的編號: 四個動作節拍硬塞進五秒,那主要是一堂「什麼塞不 進去」的課;一次交接,寫成段落式的節拍,帶一整條維持條款; 以及一張幾乎靜止的肖像,守住一張參考圖,而只有蝴蝶在動。
風格:3D 和卡通撐得住,前提是你把它立法一次
風格化的外觀 —— 3D 動畫、賽璐珞卡通、黏土動畫 —— 在一段多鏡頭的 Wan 3.0 序列裡撐得 住的程度,大約和寫實一樣好;而它們壞掉的時候,壞法也一樣:在一個改了太多東西的鏡 頭邊界上飄掉。
技巧是把風格放進全域規則,放在分鏡表上面,而不是每顆鏡頭重複一次:
Style: 3D animation, soft rounded forms, matte surfaces, no photoreal skin
texture. Palette: warm ochre, cream, one accent of teal. Key light always
from frame left. Do not change render style between shots.有兩樣東西值得放在那裡。一組點名的色票遠比「暖色調」穩定,因為模型能跨七顆鏡頭 守住三個被點名的值,卻守不住一個形容詞。而一條明確的禁令 —— do not change render style between shots —— 值得整句寫出來;官方的長篇範例在排除那一層上最強硬, 而風格飄移正是它存在要防的東西。
什麼時候該把工作拆開,而不是改提示詞
有時候對的答案不是一段更好的提示詞。如果這段序列裡有一個硬性交付物 —— 一個必須正 確的商品、一個必須落下的標誌、一句必須被說出來的台詞 —— 上面那個鏡頭數飄移,會讓 單次七鏡頭生成成為錯的工具。
行得通的替代方案:
- 先用一張靜圖把外觀鎖定一次。
- 從那張靜圖做出每顆鏡頭一張關鍵影格,每一次只改一樣東西。
- 綁定參考之後,逐顆鏡頭分開生成。
- 在本機拼接。
它會花掉更多次生成,而它給你一個你自己選的鏡頭數。當畫面裡有東西不能妥協時,值得; 做一支氛圍片,殺雞用牛刀。
而如果只有一顆鏡頭裡的某一個細節不對,不要把那顆鏡頭重新生成。 Wan 3.0 可以就 地修改一支既有的影片 —— 換掉那個道具,保住動作、服裝和畫面其餘部分 —— 那只是把整 整三十秒再擲一次骰子的一小部分成本。
關於多鏡頭的四個說法,參數表並不支持
| 流傳的說法 | 文件顯示的是 |
|---|---|
| 一個帶逐鏡頭參數的「AI 導演」模式 | 沒有這個欄位。多鏡頭是提示詞格式 |
| 一個六鏡頭的硬上限 | 根本沒有鏡頭數參數,所以沒有東西可以設上限。限制你的是三十秒和可讀性 |
| 跨工作階段的角色記憶,行銷上叫「Identity Lock」 | 沒有這個欄位,而且 Wan 3.0 沒有任何東西會在任務之間留存。一致性來自你每一次都要提供的參考綁定 |
| 跨十二種語言的音素級對嘴 | 不是一個有記載的能力。Wan 3.0 把口說和畫面一起生成;沒有公布任何語言數量 |
如果一份指南描述了一個你在請求裡表達不出來的功能,那它不是照文件寫的。這個過濾器 的用處遠遠超出這一個模型。
一份七鏡頭檢查表
- 摘要行在最前,然後編號鏡頭,然後語氣和聲音。
- 時間區間鋪滿整個長度,沒有空隙。
- 每顆鏡頭一個主要事件、一個結束狀態。
- 鏡頭之間不要寫轉場詞。
- 風格、色票和禁令放在清單上面的全域區塊裡。
- 只要那顆鏡頭裡有角色,就把服裝重講一遍。
- 最後一顆鏡頭裡不要放任何承重的東西。
常見問題
Wan 3.0 有多鏡頭或導演模式嗎?
沒有。API 裡沒有鏡頭數參數,也沒有模式可以打開。你要多顆鏡頭,就是在提示詞裡寫下帶 時間區間的編號鏡頭,而這也意味著它在每一家供應商上運作方式都一樣。
一次生成可以有幾顆鏡頭?
沒有記載的上限,因為沒有設定可以設上限。真正的限制是三十秒 —— 在 Wan 3.0 上四到五 顆鏡頭撐得最穩,而七顆在每顆約四秒的情況下可行。要得更多,模型就會開始把它們併起來。
我要怎麼讓 Wan 3.0 不要切?
寫「one continuous take」。不指定的話,模型會自己挑鏡頭覆蓋,而且通常會切,就算是 短片也一樣。
我的角色為什麼在鏡頭之間變了?
幾乎一定是因為某一個鏡頭邊界同時改了好幾樣東西。每顆鏡頭只動一個變數、每一次都把服 裝完整重講一遍,並且綁定一張身分參考圖,而不是重新描述那個人。特別盯配件 —— 帽子、 首飾和道具,飄得比臉早得多。
3D 或卡通風格和寫實一樣行得通嗎?
行,而且 Wan 3.0 跨切點守住一個風格化外觀的能力,大約和守住寫實一樣好。把風格、一組 點名的色票,以及一句明確的「do not change render style between shots」放進分鏡表上 面的全域區塊,不要逐顆鏡頭重複。
作者
wan-3.run
獨立的 Wan 3.0 介面


