Wan 3.0 提示詞指南

一份照阿里巴巴自己的公式寫的 Wan 3.0 提示詞指南:模型讀的六層、每次執行前都會跑的改寫器,以及它會演出來的對白。
2026年9月7日

一段 Wan 3.0 提示詞會被當成一顆連續鏡頭來讀,分層讀,而你留空的每一層,模型都會替你填。也就是說,一支回來不對的影片,解法幾乎從來不是一段更長的提示詞,而是把你交給運氣的那一層講出來。

整個形狀在這裡。再往下的每一段都是這六行之一,附上它出自哪條規則、以及那條規則是哪一天核對的。

Subject     誰或什麼,用你希望它保持的樣子描述
Scene       發生在哪裡,以及光在做什麼
Motion      第一秒到最後一秒之間有什麼改變
Camera      鏡頭在哪裡,會不會動
Sound       一句台詞、一個音效、一段配樂 —— 任一種,或都不要
Reference   Image 1、Video 1、Audio 1,如果你有附任何東西

把那段貼進 Wan 3.0 提示詞產生器,它會用阿里巴巴自己的句式把各層填好 —— 免費、不用帳號、沒有每日上限。或者你自己寫,然後用這一頁逐層對照。

你留空一層的時候,Wan 3.0 會做什麼

同一只懷錶、同一個種子:寫了鏡頭的那支回來是俯拍,少了 Camera 那一行的那支回來是平視

兩組配對,2026-09-07 在這裡跑的。每組內部同一個種子,改寫器關掉,480P 五秒,而兩段提示詞之間唯一的差別就是刪掉 Camera 那一行和 Sound 那一行。

有寫 Camera 和 Sound兩行都刪掉
咖啡杯,種子 71547取樣的二十個影格構圖都守住構圖整支都在飄
懷錶,種子 88213俯拍特寫,照要求平視四分之三視角 —— 同一個場景的另一顆鏡頭
杯子,音量平均 −47.5 dB,峰值 −35.9 dB平均 −16.8 dB,峰值 −2.2 dB
懷錶,音量平均 −31.5 dB,峰值 0.0 dB平均 −28.4 dB,峰值 −4.9 dB

其中兩條在兩組配對裡都成立,而且兩條都值得拿來當寫提示詞的依據:

  • 刪掉 Camera 那一行,你拿到的不是一個中性的鏡頭,是別人的選擇。 在懷錶那組,那個選擇是一個完全不同的角度 —— 俯拍變成平視,那是重新調度的另一顆鏡頭,不是同一顆的變體。
  • 刪掉 Sound 那一行,你還是會拿到聲音。 兩支沒寫聲音的影片回來都不是靜音的。如果一段沒要求的配樂對你的交付是個問題,Sound 那一層就是你攔下它的地方。

有一條沒有成立,而在你依賴它之前值得知道。「只要安靜的空間音,不要配樂也不要人聲」不是一個音量控制。 它在杯子那組把平均音量壓掉 31 dB,在懷錶那組只壓掉 3 dB,而那支要求安靜的懷錶影片,峰值仍然頂到滿刻度。Sound 那一層要寫的是該聽到什麼,不要指望它講多大聲

「鏡頭不移動」也沒有成立。 兩支要求鎖定畫面的影片都還是在飄。在這兩組配對裡,Camera 那一行穩定地買到了角度,一次都沒買到鎖定。

兩組配對就是兩組 —— 夠拿來報告發生了什麼,不夠拿來替每一種題材定一條規則。種子和設定都在上面,所以同一個測試在你自己的 Wan 3.0 brief 上大約一分鐘就能跑一遍。

你的 Wan 3.0 提示詞在執行之前會被改寫

有一個參數會改變這裡其他每一條規則的行為,而除非你把它關掉,它都是開著的。prompt_extend 預設為 true,而在它開著的時候,會有一個大型語言模型先把你打的字重寫一遍,影片模型才看得到任何東西。

有兩件事跟著發生,而兩件今天就值得處理:

  • 同一段提示詞跑兩次,不是同一段提示詞。 進去的是兩次改寫,所以進去的是兩份 brief。如果你第二次嘗試回來構圖不一樣、而你什麼都沒改,通常就是這個原因。
  • 一份單薄的 brief 得到最多,也控制得最少。 擴寫一段短提示詞,正是那個改寫器存在的目的。你給它三個字,它會把另外四十個編出來。你把六層都給滿,它能編的就很少了。

所以當你在比較一顆鏡頭的兩個版本時 —— 兩種鏡頭運動、兩套服裝 —— 先把改寫器關掉。否則是三樣東西變了,而你只看得到兩樣。

固定種子也救不了這個比較。阿里巴巴自己對 seed 的說明寫著:即使同一個值,結果也可能不會完全相同 —— 所以「同一段提示詞、同一個種子」是兩個軟主張,不是一個硬主張。

怎麼寫出 Wan 3.0 會演出來、而不是唸出來的對白

聲音是和畫面在同一次執行裡生成的,這就是為什麼一句口說台詞屬於提示詞,而不屬於一個你事後去錄的檔案。把聲音關掉不會讓影片變便宜,所以不寫它一毛錢也省不到。

阿里巴巴公布了公式:

Voice = Character's lines + Emotion + Tone + Speed + Timbre + Accent

它自己的實作範例用的是雙引號

He says, "Study hard and make progress every day," in a relaxed tone.

超過一個講話的人時,先點名、再引話:

[Character A: Black-suited Agent]
[Black-suited Agent, angrily]: "Where is the truth?"

如果你以前在這裡讀過大括號那條規則,那條寫得太強了

這個網站上曾經有七個頁面說,大括號是唯一把口說台詞和旁白分開的東西,而引號會讓一句話被唸成畫外音。大括號確實有用。「唯一」不對,關於引號那部分也不對 —— 阿里巴巴自己發布頁上的對白示範,有五個從頭到尾沒用任何大括號。2026-09-04 更正。

實際決定一句話會不會被演出來的是三件事,而你挑哪種括號不是其中之一:

  1. 把台詞逐字寫出來。 一句關於某人說了什麼的摘要,回來會是旁白。你要被聽到的那些字,必須以那些字的樣子出現。
  2. 讓它和描述分開。 一句埋在關於房間的句子裡的台詞,會被讀成房間的一部分。
  3. 把它掛在一個畫面上看得見的人身上。 一個畫面上沒有身體的聲音,是對白變成畫外音最常見的單一原因。

讓你的提示詞指向你附上去的素材

在參考模式下,提示詞可以用編號稱呼一個附件 —— Image 1Video 1Audio 1 —— 而編號是分類型各自計數的,所以圖片和影片各自從一開始數。

寫錯了不會報錯。請求照跑、照收錢,然後模型把你以為自己提供過的那個主體編出來。那個沉默才是貴的部分。

一次請求最多收 10 張參考圖、5 段合計 15 秒的影片、5 段合計 15 秒的音訊,外加一個最多 50 頁的文件或一條公開網址(二選一)。

參考素材和首/尾影格不能同行。 同時帶兩者的請求會被拒 —— 而且是排完隊之後才被拒,所以你是等到那個失敗的。動筆之前先挑家族:你確切知道鏡頭怎麼開場怎麼收尾時用關鍵影格,你需要一張臉、一件商品或一組配色撐完整支影片時用參考素材。

Wan 3.0 沒有的三個控制項

目前在這個模型上排得上名的指南,三個都描述過。沒有一個在請求結構裡,而寫一段依賴其中之一的提示詞,就是一個下午消失的方式。

你可能讀過的結構裡實際有的
一個六鏡頭的導演模式沒有鏡頭數參數,也沒有 AI 導演模式。多鏡頭是提示詞要求得來的,永遠不是某個設定保證的
Identity Lock,跨工作階段守住一個角色兩次生成之間什麼都不會被記住。沒有跨工作階段的鎖;參考素材每一次請求都要重送
一條你可以打關鍵格的攝影機軌道鏡頭運動是在 Camera 那一層用文字描述的,而且每一次生成各自詮釋

實務版本:你要的鏡頭數是一個請求,不是一份合約。 描述分明的節拍,它通常會在它們之間切。要求一顆連續鏡頭,它通常會守住。兩者都是你在操舵的傾向,而它們背後完整的參數表在 Wan 3.0 參數規格頁上。

Wan 3.0 什麼時候需要把思考打開

如果你的提示詞指向一個文件或一個網頁,enable_thinking 必須是 true,否則模型根本不會打開它。請求照樣成功、照樣收錢 —— 它只是從你的文字生成,然後忽略那個附件,而那看起來和一段爛提示詞一模一樣,但它不是。

它被描述成在第一格算出來之前,先對構圖、調度和運動進行推理,這也讓它值得在一段連續動作裡的一連串事件上試試看。阿里巴巴自己的建議是:沒有附文件或連結時就關掉它。這件事有四個各自獨立的 API 閘道一致記載,也出現在阿里巴巴自己的請求範例裡,但還沒進英文版文件 —— 所以把它當成可靠,而不是確定。2026-09-02 讀取。

照回來的東西,決定該改提示詞的哪一行

你拿到的空著的那一層該改什麼
主體在第三個節拍就飄了Subject在提示詞最後把外觀條款再講一遍,點名頭髮、服裝和顏色
那句話是唸的,不是說的Sound逐字引起來,並且掛在一個畫面上的人身上
它切到一個你從沒要求過的角度Motion描述一個連續動作,而不是一串節拍
你的文件或連結沒有任何作用思考關著。提示詞裡沒有別的東西會造成這個
沒有任何東西像你的參考照片ReferenceImage 1 稱呼它,而且分類型計數
帳單是你預期的四倍不設的話解析度預設 1080P。用 480P 打草稿,畫面是四分之一的價錢
同一段提示詞跑兩次看起來毫不相干兩次改寫器都開著。比較之前先關掉它

已經產出過影片的 Wan 3.0 提示詞

讀一條規則比讀一段有用過的提示詞慢。Wan 3.0 提示詞範例庫裡的每一則,都完整印在它產出的影片旁邊,照這同樣六層拆開,附上你可以動的那些槓桿,以及已知會弄壞它的那些改動。當你不確定的是自己 brief 的形狀時從那裡開始,當你知道是哪一層不對時回到這裡。

把一段提示詞弄對要花多少錢

把一段提示詞弄對要試幾次,而最便宜的試法是在 480P,那裡一秒的價錢是 1080P 的四分之一,而聲音一模一樣。在 480P 把用字調好,等節拍守住了移到 720P,只在你要留的那一支上花 1080P。

你可以在這裡測一段修正過的提示詞,不用信用卡:第一支免費 —— 480P、3 秒、有聲音,跑在每一個付費方案都在跑的同一個 wan3.0-video 上。 不是試用引擎,也不加浮水印。當某一段提示詞值得跑完整長度時,方案年付每月 $12.90 起,而且每一個方案都碰得到三種解析度和完整的三十秒。拿那段修正過的提示詞去跑一次。

常見問題

怎麼寫出一段好的 Wan 3.0 提示詞?

點名六件事:主體、場景、運動、鏡頭、聲音,以及任何參考素材。你留空的,模型都會替你填,所以一層沒點名,就是一層由它替你決定。長度不是那個槓桿 —— 一段六層都點名的 40 字提示詞,勝過一段少了兩層的 400 字提示詞。

我的 Wan 3.0 影片為什麼和提示詞不一樣?

最常見的原因是,在影片模型讀到它之前,有一個語言模型把提示詞重寫了。prompt_extend 預設是開的,而它對單薄的 brief 擴寫得最多。把六層都寫出來,或是把改寫器關掉,你打的字和你拿到的東西之間的落差就會收起來。

Wan 3.0 的對白需要加大括號嗎?

不需要。大括號有用,而阿里巴巴自己範例裡從頭用到尾的雙引號也有用。要緊的是那句話逐字出現、和描述分開,而且屬於一個畫面上看得見的人。

我可以跟 Wan 3.0 要一個特定的鏡頭數嗎?

你可以要,而沒有任何參數會守住它。結構裡沒有鏡頭數、也沒有導演模式,所以描述分明的節拍是一個很強的暗示,不是一個設定。

一段 Wan 3.0 提示詞可以多長?

最多 20,000 字元,中文或英文。超過的部分是被安靜截斷,不是被拒絕 —— 如果你會整份 brief 貼進去,這件事值得知道。

Wan 3.0 為什麼忽略了我的 PDF?

因為思考關著。一個文件或一條連結需要 enable_thinking 設成 true;沒有它,請求照樣跑、照樣收錢,而那個附件從來沒被打開過。

由 wan-3.run 編輯團隊撰寫與維護發布於 最後更新