數一下動詞。Rides、leaps、fights、reaches、cuts。五個節拍,其中三個涉及在一列移動中的火車上換位置,而這次請求的長度欄位寫的是五秒。那是一個節拍一秒,而一秒不夠讓一個觀眾意識到有一個節拍發生過,更不用說夠讓模型把它調度出來。
Wan 3.0 拿這種提示詞會做什麼,值得精確地理解,因為那不是大家預期的。它不截斷。它不會跑到沒時間就停。它把那份時程表壓縮進它被給的執行時間裡,也就是每一個節拍都被嘗試、每一個節拍都很趕 —— 或者,在這個比例下,多數被安靜地丟掉,而由模型挑一個來蓋整支影片。在公布的那次執行裡,它挑了第一個:在夕陽下、在塵土裡,與火車並行的那一段。那是一顆好鏡頭,而它不是提示詞描述的那顆。
這是這個類別裡最常見的失敗,而在 Wan 3.0 上,也是最容易修的那一個。這個模型生成二到三十秒之間任何一個整數秒。一段五個節拍的動作序列要的是那個範圍的頂端。把數字拉上去要花六倍的點數,換到的是一支真的裝著你寫的那些東西的影片 —— 那比壓縮版跑五次是更好的交換。
光是把數字拉上去,並不會給那些節拍一個順序。Wan 3.0 裡沒有時間碼語法。寫「0-6s: she rides alongside」會花掉字元、什麼也買不到;模型把它讀成文字。真正有用的文法是普通英文的連接詞 —— then、after that、finally —— 而其中最要緊的是最後那個。一支三十秒的影片,如果它的提示詞從來沒說它怎麼結束,它就會自己編一個結尾,而編出來的結尾幾乎總是從動作裡緩緩飄出去,而不是切在最強的那張畫面上。這裡的結尾其實已經寫在故事裡了:那節車廂沿著另一條軌道滾開。它只需要前面加一個 `finally`。
這段提示詞裡有兩樣東西安靜地出色,不管你拿其餘部分怎麼辦,這兩樣都值得帶走。第一樣是那個面罩。一個戴面罩的主角,拿掉了這顆鏡頭裡最難的連戲問題 —— 沒有一張臉要在一次躍起和一場打鬥之間保持穩定 —— 並且把那份算力還給了運動。只要身分不是重點,就把臉遮起來。
第二樣是「practical stunt realism」。生成的動作傾向於失重:身體浮著劃過弧線、撞擊沒有後續、馬匹用滑的。那三個字要的正好相反,而它們做到這件事的方式,是點名一種**製作方法**而不是一種視覺屬性,而那是一條強得多的指示。「Realistic」是一個願望。「Practical stunt」是一種拍攝方式,而模型看過大量用那種方式拍出來的素材。
關於這個模式有一個結構性的註記。這是參考圖生影片,在 Wan 3.0 上意味著單次請求最多十張圖、五段影片和五段音訊 —— 而且有一套真的語法配著它。素材在提示詞裡用 `Image 1`、`Video 1`、`Audio 1` 稱呼:首字大寫、中間有空格、依照它們在陣列裡的順序編號。這段提示詞一樣都沒用,那對一個公開樣本沒問題,對一次正式請求則是錯的。如果那個亡命之徒、那列火車和那道峽谷是你手上有圖的東西,就用編號說出來,模型就不會再去編它們。
最後,帳單。參考影片是 Wan 3.0 唯一會收錢的輸入:一段來源影片按和輸出相同的每秒費率計費,並且算進同一個三十秒的上限。十張參考圖是免費的,而一段十五秒的參考影片是你能附加到一次請求上最貴的東西。沒有人在寫這個模型的時候把這件事講明白,而它正是會讓人意外的那一筆。