Wan 3.0 提示詞指南
一段 Wan 3.0 提示詞會被當成一顆連續鏡頭來讀,分層讀,而你留空的每一層,模型都會替你填。也就是說,一支回來不對的影片,解法幾乎從來不是一段更長的提示詞,而是把你交給運氣的那一層講出來。
整個形狀在這裡。再往下的每一段都是這六行之一,附上它出自哪條規則、以及那條規則是哪一天核對的。
Subject 誰或什麼,用你希望它保持的樣子描述
Scene 發生在哪裡,以及光在做什麼
Motion 第一秒到最後一秒之間有什麼改變
Camera 鏡頭在哪裡,會不會動
Sound 一句台詞、一個音效、一段配樂 —— 任一種,或都不要
Reference Image 1、Video 1、Audio 1,如果你有附任何東西把那段貼進 Wan 3.0 提示詞產生器,它會用阿里巴巴自己的句式把各層填好 —— 免費、不用帳號、沒有每日上限。或者你自己寫,然後用這一頁逐層對照。
你留空一層的時候,Wan 3.0 會做什麼

兩組配對,2026-09-07 在這裡跑的。每組內部同一個種子,改寫器關掉,480P 五秒,而兩段提示詞之間唯一的差別就是刪掉 Camera 那一行和 Sound 那一行。
| 有寫 Camera 和 Sound | 兩行都刪掉 | |
|---|---|---|
| 咖啡杯,種子 71547 | 取樣的二十個影格構圖都守住 | 構圖整支都在飄 |
| 懷錶,種子 88213 | 俯拍特寫,照要求 | 平視四分之三視角 —— 同一個場景的另一顆鏡頭 |
| 杯子,音量 | 平均 −47.5 dB,峰值 −35.9 dB | 平均 −16.8 dB,峰值 −2.2 dB |
| 懷錶,音量 | 平均 −31.5 dB,峰值 0.0 dB | 平均 −28.4 dB,峰值 −4.9 dB |
其中兩條在兩組配對裡都成立,而且兩條都值得拿來當寫提示詞的依據:
- 刪掉 Camera 那一行,你拿到的不是一個中性的鏡頭,是別人的選擇。 在懷錶那組,那個選擇是一個完全不同的角度 —— 俯拍變成平視,那是重新調度的另一顆鏡頭,不是同一顆的變體。
- 刪掉 Sound 那一行,你還是會拿到聲音。 兩支沒寫聲音的影片回來都不是靜音的。如果一段沒要求的配樂對你的交付是個問題,Sound 那一層就是你攔下它的地方。
有一條沒有成立,而在你依賴它之前值得知道。「只要安靜的空間音,不要配樂也不要人聲」不是一個音量控制。 它在杯子那組把平均音量壓掉 31 dB,在懷錶那組只壓掉 3 dB,而那支要求安靜的懷錶影片,峰值仍然頂到滿刻度。Sound 那一層要寫的是該聽到什麼,不要指望它講多大聲。
「鏡頭不移動」也沒有成立。 兩支要求鎖定畫面的影片都還是在飄。在這兩組配對裡,Camera 那一行穩定地買到了角度,一次都沒買到鎖定。
兩組配對就是兩組 —— 夠拿來報告發生了什麼,不夠拿來替每一種題材定一條規則。種子和設定都在上面,所以同一個測試在你自己的 Wan 3.0 brief 上大約一分鐘就能跑一遍。
你的 Wan 3.0 提示詞在執行之前會被改寫
有一個參數會改變這裡其他每一條規則的行為,而除非你把它關掉,它都是開著的。prompt_extend 預設為 true,而在它開著的時候,會有一個大型語言模型先把你打的字重寫一遍,影片模型才看得到任何東西。
有兩件事跟著發生,而兩件今天就值得處理:
- 同一段提示詞跑兩次,不是同一段提示詞。 進去的是兩次改寫,所以進去的是兩份 brief。如果你第二次嘗試回來構圖不一樣、而你什麼都沒改,通常就是這個原因。
- 一份單薄的 brief 得到最多,也控制得最少。 擴寫一段短提示詞,正是那個改寫器存在的目的。你給它三個字,它會把另外四十個編出來。你把六層都給滿,它能編的就很少了。
所以當你在比較一顆鏡頭的兩個版本時 —— 兩種鏡頭運動、兩套服裝 —— 先把改寫器關掉。否則是三樣東西變了,而你只看得到兩樣。
固定種子也救不了這個比較。阿里巴巴自己對 seed 的說明寫著:即使同一個值,結果也可能不會完全相同 —— 所以「同一段提示詞、同一個種子」是兩個軟主張,不是一個硬主張。
怎麼寫出 Wan 3.0 會演出來、而不是唸出來的對白
聲音是和畫面在同一次執行裡生成的,這就是為什麼一句口說台詞屬於提示詞,而不屬於一個你事後去錄的檔案。把聲音關掉不會讓影片變便宜,所以不寫它一毛錢也省不到。
阿里巴巴公布了公式:
Voice = Character's lines + Emotion + Tone + Speed + Timbre + Accent它自己的實作範例用的是雙引號:
He says, "Study hard and make progress every day," in a relaxed tone.
超過一個講話的人時,先點名、再引話:
[Character A: Black-suited Agent]
[Black-suited Agent, angrily]: "Where is the truth?"如果你以前在這裡讀過大括號那條規則,那條寫得太強了
這個網站上曾經有七個頁面說,大括號是唯一把口說台詞和旁白分開的東西,而引號會讓一句話被唸成畫外音。大括號確實有用。「唯一」不對,關於引號那部分也不對 —— 阿里巴巴自己發布頁上的對白示範,有五個從頭到尾沒用任何大括號。2026-09-04 更正。
實際決定一句話會不會被演出來的是三件事,而你挑哪種括號不是其中之一:
- 把台詞逐字寫出來。 一句關於某人說了什麼的摘要,回來會是旁白。你要被聽到的那些字,必須以那些字的樣子出現。
- 讓它和描述分開。 一句埋在關於房間的句子裡的台詞,會被讀成房間的一部分。
- 把它掛在一個畫面上看得見的人身上。 一個畫面上沒有身體的聲音,是對白變成畫外音最常見的單一原因。
讓你的提示詞指向你附上去的素材
在參考模式下,提示詞可以用編號稱呼一個附件 —— Image 1、Video 1、Audio 1 —— 而編號是分類型各自計數的,所以圖片和影片各自從一開始數。
寫錯了不會報錯。請求照跑、照收錢,然後模型把你以為自己提供過的那個主體編出來。那個沉默才是貴的部分。
一次請求最多收 10 張參考圖、5 段合計 15 秒的影片、5 段合計 15 秒的音訊,外加一個最多 50 頁的文件或一條公開網址(二選一)。
參考素材和首/尾影格不能同行。 同時帶兩者的請求會被拒 —— 而且是排完隊之後才被拒,所以你是等到那個失敗的。動筆之前先挑家族:你確切知道鏡頭怎麼開場怎麼收尾時用關鍵影格,你需要一張臉、一件商品或一組配色撐完整支影片時用參考素材。
Wan 3.0 沒有的三個控制項
目前在這個模型上排得上名的指南,三個都描述過。沒有一個在請求結構裡,而寫一段依賴其中之一的提示詞,就是一個下午消失的方式。
| 你可能讀過的 | 結構裡實際有的 |
|---|---|
| 一個六鏡頭的導演模式 | 沒有鏡頭數參數,也沒有 AI 導演模式。多鏡頭是提示詞要求得來的,永遠不是某個設定保證的 |
| Identity Lock,跨工作階段守住一個角色 | 兩次生成之間什麼都不會被記住。沒有跨工作階段的鎖;參考素材每一次請求都要重送 |
| 一條你可以打關鍵格的攝影機軌道 | 鏡頭運動是在 Camera 那一層用文字描述的,而且每一次生成各自詮釋 |
實務版本:你要的鏡頭數是一個請求,不是一份合約。 描述分明的節拍,它通常會在它們之間切。要求一顆連續鏡頭,它通常會守住。兩者都是你在操舵的傾向,而它們背後完整的參數表在 Wan 3.0 參數規格頁上。
Wan 3.0 什麼時候需要把思考打開
如果你的提示詞指向一個文件或一個網頁,enable_thinking 必須是 true,否則模型根本不會打開它。請求照樣成功、照樣收錢 —— 它只是從你的文字生成,然後忽略那個附件,而那看起來和一段爛提示詞一模一樣,但它不是。
它被描述成在第一格算出來之前,先對構圖、調度和運動進行推理,這也讓它值得在一段連續動作裡的一連串事件上試試看。阿里巴巴自己的建議是:沒有附文件或連結時就關掉它。這件事有四個各自獨立的 API 閘道一致記載,也出現在阿里巴巴自己的請求範例裡,但還沒進英文版文件 —— 所以把它當成可靠,而不是確定。2026-09-02 讀取。
照回來的東西,決定該改提示詞的哪一行
| 你拿到的 | 空著的那一層 | 該改什麼 |
|---|---|---|
| 主體在第三個節拍就飄了 | Subject | 在提示詞最後把外觀條款再講一遍,點名頭髮、服裝和顏色 |
| 那句話是唸的,不是說的 | Sound | 逐字引起來,並且掛在一個畫面上的人身上 |
| 它切到一個你從沒要求過的角度 | Motion | 描述一個連續動作,而不是一串節拍 |
| 你的文件或連結沒有任何作用 | — | 思考關著。提示詞裡沒有別的東西會造成這個 |
| 沒有任何東西像你的參考照片 | Reference | 用 Image 1 稱呼它,而且分類型計數 |
| 帳單是你預期的四倍 | — | 不設的話解析度預設 1080P。用 480P 打草稿,畫面是四分之一的價錢 |
| 同一段提示詞跑兩次看起來毫不相干 | — | 兩次改寫器都開著。比較之前先關掉它 |
已經產出過影片的 Wan 3.0 提示詞
讀一條規則比讀一段有用過的提示詞慢。Wan 3.0 提示詞範例庫裡的每一則,都完整印在它產出的影片旁邊,照這同樣六層拆開,附上你可以動的那些槓桿,以及已知會弄壞它的那些改動。當你不確定的是自己 brief 的形狀時從那裡開始,當你知道是哪一層不對時回到這裡。
把一段提示詞弄對要花多少錢
把一段提示詞弄對要試幾次,而最便宜的試法是在 480P,那裡一秒的價錢是 1080P 的四分之一,而聲音一模一樣。在 480P 把用字調好,等節拍守住了移到 720P,只在你要留的那一支上花 1080P。
你可以在這裡測一段修正過的提示詞,不用信用卡:第一支免費 —— 480P、3 秒、有聲音,跑在每一個付費方案都在跑的同一個 wan3.0-video 上。 不是試用引擎,也不加浮水印。當某一段提示詞值得跑完整長度時,方案年付每月 $12.90 起,而且每一個方案都碰得到三種解析度和完整的三十秒。拿那段修正過的提示詞去跑一次。
常見問題
怎麼寫出一段好的 Wan 3.0 提示詞?
點名六件事:主體、場景、運動、鏡頭、聲音,以及任何參考素材。你留空的,模型都會替你填,所以一層沒點名,就是一層由它替你決定。長度不是那個槓桿 —— 一段六層都點名的 40 字提示詞,勝過一段少了兩層的 400 字提示詞。
我的 Wan 3.0 影片為什麼和提示詞不一樣?
最常見的原因是,在影片模型讀到它之前,有一個語言模型把提示詞重寫了。prompt_extend 預設是開的,而它對單薄的 brief 擴寫得最多。把六層都寫出來,或是把改寫器關掉,你打的字和你拿到的東西之間的落差就會收起來。
Wan 3.0 的對白需要加大括號嗎?
不需要。大括號有用,而阿里巴巴自己範例裡從頭用到尾的雙引號也有用。要緊的是那句話逐字出現、和描述分開,而且屬於一個畫面上看得見的人。
我可以跟 Wan 3.0 要一個特定的鏡頭數嗎?
你可以要,而沒有任何參數會守住它。結構裡沒有鏡頭數、也沒有導演模式,所以描述分明的節拍是一個很強的暗示,不是一個設定。
一段 Wan 3.0 提示詞可以多長?
最多 20,000 字元,中文或英文。超過的部分是被安靜截斷,不是被拒絕 —— 如果你會整份 brief 貼進去,這件事值得知道。
Wan 3.0 為什麼忽略了我的 PDF?
因為思考關著。一個文件或一條連結需要 enable_thinking 設成 true;沒有它,請求照樣跑、照樣收錢,而那個附件從來沒被打開過。
由 wan-3.run 編輯團隊撰寫與維護發布於 最後更新