兩百五十四個字元,對上兩萬字元的上限。這段提示詞用掉大約百分之一的額度,而它是這個庫裡寫得最好的東西。
理由是:圖片轉影片和文字轉影片是不同的工作,而多數人把它當成同一份工作加了一張圖來寫。在文字轉影片裡,提示詞是唯一的真實來源,所以它必須承載實體、場景、運動、美學和風格。在圖片轉影片裡,那個影格已經承載了實體、場景、美學和風格 —— 而且比散文詳細得多,也沒有歧義。影格承載不了的是時間。所以提示詞剛好只有一份工作:說什麼在變。
看看這段文字拒絕做什麼。它從來沒說那隻龍是綠的、大的、有鱗的。它對森林的描述沒有超過安置粒子所需的那三個字。它沒給鏡頭、沒給調色、沒給類型、沒給氛圍。這裡面每一樣都會是一個關於已經定案的事情的第二意見,而當提示詞和參考影格不一致時,模型不會挑一個贏家 —— 它會內插。內插出來的細節是軟的,而軟細節正是大家說一次執行「看起來很 AI」的時候在講的東西。
那四個改變是從最小排到最大的:眼睛、葉子、粒子、走進畫面的遊俠。那個排序,正是讓五秒感覺像在堆疊而不是一次全部發生的原因。它同時也悄悄是一次尺度的升級 —— 一片眼皮、然後是枝葉、然後是空氣、然後是一個橫過畫面的人 —— 而那和西洋棋那段提示詞用表情做的,是同一個結構性的動作。
最好的是第二句。「Leaves move from its breathing」從來沒要求那隻龍呼吸。它點名一個看得見的結果,把原因留成隱含的,這就逼著模型為了合理化那個效果而去產生那個原因。那是一個可靠的技巧,而且可以推廣:蒸氣在鍋上彎折、灰塵從路面揚起、一件外套在人停下之後落定。點名效果,你得到運動;點名運動,你得到那個詞的動畫。
鏡頭那一行用另一種register做同一件事。「Slowly circles around both characters revealing the enormous scale difference」在一個運動上掛了一個目的。Wan 3.0 沒有環繞半徑或鏡頭高度這種參數,而把數字寫進散文裡也不會生出參數來 —— 但「revealing the scale difference」暗示了一個夠寬的弧線和一個夠低的角度,好把兩個身體都留在畫面裡,而那正是那些數字本來要做的事。
重跑時唯一該加的是聲音。一隻在安靜空地上呼吸的龍,是一份會自己寫出來的音效設計 brief,而 Wan 3.0 是在和畫面同一次執行裡生成聲音的 —— 這意味著一句聲音指示同時也是一條時間指示。「A low slow breath under forest ambience, no music」會把那個呼吸放在一個具體的位置,而不是留給模型,而那個呼吸正是整支影片建立在上面的那個節拍。
最後,是這個模式上專門會絆倒人的那條限制:一個第一影格和一張參考圖不能出現在同一個請求裡。Wan 3.0 把關鍵影格家族和參考家族視為互斥,並且拒絕這個組合。如果你想要龍來自一張圖、遊俠來自另一張,那是參考圖生影片,而它就是這一頁上接下來的兩個範本。