P—05 / 沙漠列車劫案

Wan 3.0 參考圖生影片提示詞 —— 五秒裡四個節拍

一整個第二幕被寫進一次五秒的請求裡。看看哪一個節拍活下來。

她策馬與列車並行、躍上車廂、在車頂一路打過去、抵達一節有人看守的車廂,然後把它切斷。那是四個節拍加一次場景轉換,而長度欄位寫的是五秒。這個範本會在庫裡,是因為這種不匹配是一次 Wan 3.0 請求最常見的毛病,也因為 Wan 3.0 正好是那個「解法就是直接要三十秒」的模型。

模式
參考圖生影片
模型
Wan 3.0
長度
5s
比例
16:9
解析度
720P
音訊
動作場面聲音底,在同一次執行裡生成
點數
80

阿里巴巴為這個模型公布的示例 —— 不是在本站生成的。 來源:wavespeed.ai

Output reference

一位戴著面罩的騎士騎著黑馬,在夕陽下的沙漠裡與一列蒸汽火車並行奔馳影片
這支片子

10 張圖 · 5 段影片 · 5 段音訊 · 影片合計 15 秒

594 / 20,000

參考素材 要用點數。免費那支是給提示詞或一張照片、出一支片子 —— 讓我們去讀檔案、連結或你手上的素材,是同一個 Wan 3.0 模型的付費那一側。看看一支片子多少錢

1 支免費 · WAN 3.0 · 480P

01 —— 內部

一條提示詞,一套流程

片子擺在做出它的那條提示詞旁邊,整條印出來。把它複製進上面的控制台,改你需要改的,然後生成。

參考產出

一位戴著面罩的騎士騎著黑馬,在夕陽下的沙漠裡與一列蒸汽火車並行奔馳影片
片子
這條提示詞the clipWan 3.0 · 參考圖生影片
594 chars

劫案

三句逐步升級的動作,然後一句幾乎全是鏡頭語言的收尾子句。

A steam train races across an endless desert at sunset while a masked female outlaw rides beside it on a black horse. She leaps onto the moving train, fights her way across the roof, and reaches a guarded carriage carrying a frightened young prisoner. As soldiers surround them, she cuts the carriage loose, sending it down a different track toward a distant canyon. Epic western action film, fast-paced camera movement, dynamic horseback tracking shots, dramatic close combat, sweeping aerial views, flying dust, golden sunset, practical stunt realism, anamorphic lens flares, cinematic scale.

6 層

每一層在做什麼

Wan 3.0 讀的是一整條白話字串,但它是順著接縫讀的。拿走一層,而不是整條提示詞 —— 美學和聲音那兩行幾乎能換到任何主體上,而它們正是大多數人寫得最差的兩行。

  1. Entity

    a masked female outlaw … a frightened young prisoner … soldiers

    三方人馬,每一方一個形容詞,而那個面罩在做安靜的工作 —— 一張被遮住的臉,是模型不會弄丟連戲的臉。

  2. Scene

    an endless desert at sunset … the moving train … a guarded carriage … a distant canyon

    四個地點,全部在同一列火車上或旁邊。那是這件事還勉強算得上一顆鏡頭、而不是一段序列的唯一理由。

  3. Motion

    rides beside it … leaps onto … fights her way across the roof … reaches … cuts the carriage loose

    五個動詞,每一個本身都是一個節拍。這就是塞不下的那一層,而這也正是值得去數一數你自己提示詞裡動詞數量的理由。

  4. Aesthetic control

    fast-paced camera movement, dynamic horseback tracking shots, dramatic close combat, sweeping aerial views, flying dust … anamorphic lens flares

    一句話裡點名了四種不同的鏡頭覆蓋。和那些動詞一樣,這是一張假裝成風格註記的分鏡表。

  5. Stylization

    Epic western action film … golden sunset, practical stunt realism … cinematic scale

    「Practical stunt realism」是這段提示詞裡最好的一個詞組。它要的是重量和後果,不是流暢而不可能的運動,而重量正是讓生成的動作讀得出來的東西。

  6. Sound

    沒寫 —— 留給模型。

    沒寫 —— 而這顆鏡頭的主體整個就是一列蒸汽火車。馬蹄、連結器、風聲,外加不要配樂,一句話就搞定。

4 個可調項

把它變成你的

哪些改動是安全的。多數庫只發布這一份清單,這也是為什麼那麼多複製來的提示詞跑出來比原作還差。

  1. 01

    長度欄位

    這才是真正的槓桿,而它不在文字裡。Wan 3.0 生成二到三十秒之間任何一個整數秒。一段裡面有五個節拍的提示詞要的是三十,而三十是上一代模型根本給不出來的數字。

  2. 02

    那個面罩

    一個戴面罩的主角是一種連戲上的作弊,而且是好的那種。沒有一張臉要在一次躍起、一場打鬥和一次切斷之間保持一致,所以模型會把那份注意力花到運動上。只要身分不是重點,就用它。

  3. 03

    「Practical stunt realism」

    三個要求重量的字。它們是為什麼那匹馬和那列火車讀起來像沉重的物體、而不是被動畫化的形狀,而且它們可以移植到任何有物理的東西上 —— 一次墜落、一扇門、一次撞擊。

  4. 04

    那張鏡頭覆蓋清單

    跟拍、貼身格鬥、空拍。留一個,這五秒就有一顆鏡頭;三個都留,它就有一支剪不出來的預告片。如果你把長度拉上去,那就三個都留,一個節拍配一個。

三種把它弄壞的方式

  • 長度欄位就留在五秒

    面對一段對它的執行時間來說太長的提示詞,Wan 3.0 不會截斷 —— 它會壓縮。每一個節拍都提早、匆忙地抵達,或者多數被丟掉、而由模型決定丟哪些。不管哪一種,結果都是模型決定的,不是你決定的。

  • 加時間碼,而不是把長度拉上去

    把「0-8s」「8-16s」寫進散文裡,除了花掉字元之外什麼也沒做。Wan 3.0 沒有時間碼文法。順序來自連接詞 —— then、after that、finally —— 而長度來自那個長度參數。

  • 附一個第一影格,好給那個亡命之徒一張臉

    在 Wan 3.0 裡參考素材和關鍵影格互斥,混用會在請求排完隊之後以 `InvalidParameter` 被拒。如果你在這裡需要一張特定的臉,它屬於 `reference_image_urls`,而提示詞去引用 `Image 1`。

它做什麼

沙漠列車劫案 這個範本做什麼

數一下動詞。Rides、leaps、fights、reaches、cuts。五個節拍,其中三個涉及在一列移動中的火車上換位置,而這次請求的長度欄位寫的是五秒。那是一個節拍一秒,而一秒不夠讓一個觀眾意識到有一個節拍發生過,更不用說夠讓模型把它調度出來。

Wan 3.0 拿這種提示詞會做什麼,值得精確地理解,因為那不是大家預期的。它不截斷。它不會跑到沒時間就停。它把那份時程表壓縮進它被給的執行時間裡,也就是每一個節拍都被嘗試、每一個節拍都很趕 —— 或者,在這個比例下,多數被安靜地丟掉,而由模型挑一個來蓋整支影片。在公布的那次執行裡,它挑了第一個:在夕陽下、在塵土裡,與火車並行的那一段。那是一顆好鏡頭,而它不是提示詞描述的那顆。

這是這個類別裡最常見的失敗,而在 Wan 3.0 上,也是最容易修的那一個。這個模型生成二到三十秒之間任何一個整數秒。一段五個節拍的動作序列要的是那個範圍的頂端。把數字拉上去要花六倍的點數,換到的是一支真的裝著你寫的那些東西的影片 —— 那比壓縮版跑五次是更好的交換。

光是把數字拉上去,並不會給那些節拍一個順序。Wan 3.0 裡沒有時間碼語法。寫「0-6s: she rides alongside」會花掉字元、什麼也買不到;模型把它讀成文字。真正有用的文法是普通英文的連接詞 —— then、after that、finally —— 而其中最要緊的是最後那個。一支三十秒的影片,如果它的提示詞從來沒說它怎麼結束,它就會自己編一個結尾,而編出來的結尾幾乎總是從動作裡緩緩飄出去,而不是切在最強的那張畫面上。這裡的結尾其實已經寫在故事裡了:那節車廂沿著另一條軌道滾開。它只需要前面加一個 `finally`。

這段提示詞裡有兩樣東西安靜地出色,不管你拿其餘部分怎麼辦,這兩樣都值得帶走。第一樣是那個面罩。一個戴面罩的主角,拿掉了這顆鏡頭裡最難的連戲問題 —— 沒有一張臉要在一次躍起和一場打鬥之間保持穩定 —— 並且把那份算力還給了運動。只要身分不是重點,就把臉遮起來。

第二樣是「practical stunt realism」。生成的動作傾向於失重:身體浮著劃過弧線、撞擊沒有後續、馬匹用滑的。那三個字要的正好相反,而它們做到這件事的方式,是點名一種**製作方法**而不是一種視覺屬性,而那是一條強得多的指示。「Realistic」是一個願望。「Practical stunt」是一種拍攝方式,而模型看過大量用那種方式拍出來的素材。

關於這個模式有一個結構性的註記。這是參考圖生影片,在 Wan 3.0 上意味著單次請求最多十張圖、五段影片和五段音訊 —— 而且有一套真的語法配著它。素材在提示詞裡用 `Image 1`、`Video 1`、`Audio 1` 稱呼:首字大寫、中間有空格、依照它們在陣列裡的順序編號。這段提示詞一樣都沒用,那對一個公開樣本沒問題,對一次正式請求則是錯的。如果那個亡命之徒、那列火車和那道峽谷是你手上有圖的東西,就用編號說出來,模型就不會再去編它們。

最後,帳單。參考影片是 Wan 3.0 唯一會收錢的輸入:一段來源影片按和輸出相同的每秒費率計費,並且算進同一個三十秒的上限。十張參考圖是免費的,而一段十五秒的參考影片是你能附加到一次請求上最貴的東西。沒有人在寫這個模型的時候把這件事講明白,而它正是會讓人意外的那一筆。

這裡的一切都在參考圖生影片裡跑。

6 個問題

沙漠列車劫案 —— 常見問題

  • 01

    當一段提示詞描述的東西超過長度允許的範圍會怎樣?

    Wan 3.0 是壓縮而不是截斷。每一個節拍都被嘗試而且很趕,或者多數被丟掉、而由模型挑要留哪一個。

  • 02

    一支 Wan 3.0 影片可以多長?

    二到三十秒之間任何一個整數秒。像這樣一段五個節拍的序列,要的是那個範圍的頂端,不是底端。

  • 03

    時間碼有助於替節拍排序嗎?

    沒有。這裡沒有時間碼文法。用連接詞 —— then、after that、finally —— 並且把結尾用文字寫出來,因為一個沒寫的結尾會被編出來。

  • 04

    我要怎麼在提示詞裡引用一張附上去的圖?

    寫成 `Image 1`,首字大寫、中間有空格,依它在陣列裡的位置編號。小寫或黏在一起的寫法綁不到任何東西。

  • 05

    參考素材要另外收錢嗎?

    參考影片要 —— 它按輸出費率計費,並且算進那三十秒的總額。參考圖、音訊、文件和連結不用。

  • 06

    我可以加一個第一影格來鎖定開場構圖嗎?

    不能放在同一個請求裡。關鍵影格和參考素材互斥,這個組合會被直接拒絕。

複製它,改一層,跑起來。

每一個字元都在這一頁上。720P 的 5s 要 80 點。

由 wan-3.run 編輯團隊撰寫與維護發布於 最後更新