P—03 / 巨龍睜開眼睛

Wan 3.0 圖片轉影片提示詞 —— 描述改變,不要描述畫面

兩百五十四個字元,因為第一個影格已經把其餘的都說完了。

這個庫裡最短的一段提示詞,而它短是有理由的,不是因為偷懶。一個第一影格已經帶著那隻生物、那片森林、那道光、那組色彩和那種風格 —— 所以上面每一個字要嘛是多餘的,要嘛更糟:是一個模型必須拿去和眼前那張圖調和的第二意見。剩下要寫的,只有影格裝不下的那一樣東西:什麼在動。

模式
圖片轉影片
模型
Wan 3.0
長度
5s
比例
16:9
解析度
720P
音訊
森林環境底,在同一次執行裡生成
點數
80

阿里巴巴為這個模型公布的示例 —— 不是在本站生成的。 來源:wavespeed.ai

Output reference

一位小小的遊俠伸手觸向一隻躺在陽光林間空地上的巨大綠龍影片
這支片子

JPG · PNG · BMP · WebP · ≤20 MB · 240–8000px · ratio ≤8:1

254 / 20,000

免費那支就是同一個 Wan 3.0,聲音也有,上限是 480P · 3s,走的是共用佇列。方案能把上限抬高到 1080P 和三十秒 —— 免費檔是一個解析度,不是另一個模型。

1 支免費 · WAN 3.0 · 480P

01 —— 內部

一條提示詞,一套流程

片子擺在做出它的那條提示詞旁邊,整條印出來。把它複製進上面的控制台,改你需要改的,然後生成。

參考產出

一位小小的遊俠伸手觸向一隻躺在陽光林間空地上的巨大綠龍影片
片子
這條提示詞the clipWan 3.0 · 圖片轉影片
254 chars

甦醒

四個改變加一個鏡頭運動。沒有生物描述、沒有森林描述,一個風格詞都沒有。

The dragon slowly opens its eyes, leaves move from its breathing, glowing particles float around the forest, the ranger slowly steps forward and reaches out a hand. The camera slowly circles around both characters revealing the enormous scale difference.

6 層

每一層在做什麼

Wan 3.0 讀的是一整條白話字串,但它是順著接縫讀的。拿走一層,而不是整條提示詞 —— 美學和聲音那兩行幾乎能換到任何主體上,而它們正是大多數人寫得最差的兩行。

  1. Entity

    The dragon … the ranger

    定冠詞,不做描述。`the` 告訴模型這些是畫面裡已經有的東西;`a dragon` 則會邀請它再生出第二隻。

  2. Scene

    around the forest

    三個字,而且只是因為那些粒子需要一個待的地方。那個影格就是場景。重新描述它,正是一段圖片轉影片提示詞和自己的參考圖打起來的方式。

  3. Motion

    slowly opens its eyes, leaves move from its breathing, glowing particles float … steps forward and reaches out a hand

    四個改變,從最小排到最大,而其中一個 —— 葉子因為牠的呼吸而動 —— 是一個二階效果。點名一個結果,就是讓模型去把原因動畫化的方法。

  4. Aesthetic control

    The camera slowly circles around both characters revealing the enormous scale difference.

    一個帶著目的的運動。「Revealing the enormous scale difference」告訴模型這個環繞是為了什麼,而那對半徑和高度的約束,遠比一個數字有效。

  5. Stylization

    沒寫 —— 留給模型。

    不存在,而且是對的。那張參考影格就是風格表。一個風格詞放在這裡會和畫面競爭,而在邊緣地帶通常是畫面輸。

  6. Sound

    沒寫 —— 留給模型。

    沒寫。一片森林加一隻在呼吸的龍,已經夠模型編出一些說得過去的東西,但那個呼吸才是重要的聲音,而它沒有被點名。

4 個可調項

把它變成你的

哪些改動是安全的。多數庫只發布這一份清單,這也是為什麼那麼多複製來的提示詞跑出來比原作還差。

  1. 01

    結果子句

    「Leaves move from its breathing」是這段提示詞裡最好的一句。它從來沒說那隻龍在呼吸 —— 它點名一個看得見的效果,讓模型自己倒推回原因。那讀起來有生命的程度,是「the dragon breathes」做不到的,而且它可以移植到任何東西上:蒸氣彎折、灰塵揚起、布料落定。

  2. 02

    掛在鏡頭上的目的

    一個有明確任務的環繞。換掉它要揭示的東西 —— 那位遊俠的臉、那片空地的縱深、龍後面有什麼 —— 同一個動詞就會產生一條不同的路徑,而你不必去指定半徑、高度或方向。

  3. 03

    刻意缺席的那些

    沒有鱗片、沒有顏色、沒有燈光、沒有鏡頭、沒有類型。加上任何一個,你就是在要求模型把你的字和一張已經不同意的影格調和起來。一次圖片轉影片執行出錯,最常見的方式就是一段去描述畫面的提示詞。

  4. 04

    那些改變的順序

    眼睛,然後葉子,然後粒子,然後那位遊俠。從最小到最大,這讓五秒能夠堆疊起來。把遊俠放到最前面,龍的甦醒就變成一個反應,而不是那個事件。

三種把它弄壞的方式

  • 同時附上參考圖和第一影格

    Wan 3.0 把首/尾影格和參考家族視為互斥,混用會直接以 `InvalidParameter` 被拒。這是建構出一個不可能成功的請求最容易的一種方式,而且那個拒絕是在排完隊之後才抵達,不是在之前。

  • 重新描述那個主體

    在一張已經顯示著一隻龍的影格旁邊寫「a large green scaled dragon」,等於給了模型同一件事實的兩個來源。在它們不一致的地方,它會取平均,而平均出來的細節,正是大家怪罪模型的那種糊。

  • 要求一個切點

    一次圖片轉影片執行是從你的影格出發,並且和它保持連續。第二個地點沒有東西可以連續,所以模型要嘛忽略那個指示、要嘛用溶接 —— 而五秒裝不下一次溶接。

它做什麼

巨龍睜開眼睛 這個範本做什麼

兩百五十四個字元,對上兩萬字元的上限。這段提示詞用掉大約百分之一的額度,而它是這個庫裡寫得最好的東西。

理由是:圖片轉影片和文字轉影片是不同的工作,而多數人把它當成同一份工作加了一張圖來寫。在文字轉影片裡,提示詞是唯一的真實來源,所以它必須承載實體、場景、運動、美學和風格。在圖片轉影片裡,那個影格已經承載了實體、場景、美學和風格 —— 而且比散文詳細得多,也沒有歧義。影格承載不了的是時間。所以提示詞剛好只有一份工作:說什麼在變。

看看這段文字拒絕做什麼。它從來沒說那隻龍是綠的、大的、有鱗的。它對森林的描述沒有超過安置粒子所需的那三個字。它沒給鏡頭、沒給調色、沒給類型、沒給氛圍。這裡面每一樣都會是一個關於已經定案的事情的第二意見,而當提示詞和參考影格不一致時,模型不會挑一個贏家 —— 它會內插。內插出來的細節是軟的,而軟細節正是大家說一次執行「看起來很 AI」的時候在講的東西。

那四個改變是從最小排到最大的:眼睛、葉子、粒子、走進畫面的遊俠。那個排序,正是讓五秒感覺像在堆疊而不是一次全部發生的原因。它同時也悄悄是一次尺度的升級 —— 一片眼皮、然後是枝葉、然後是空氣、然後是一個橫過畫面的人 —— 而那和西洋棋那段提示詞用表情做的,是同一個結構性的動作。

最好的是第二句。「Leaves move from its breathing」從來沒要求那隻龍呼吸。它點名一個看得見的結果,把原因留成隱含的,這就逼著模型為了合理化那個效果而去產生那個原因。那是一個可靠的技巧,而且可以推廣:蒸氣在鍋上彎折、灰塵從路面揚起、一件外套在人停下之後落定。點名效果,你得到運動;點名運動,你得到那個詞的動畫。

鏡頭那一行用另一種register做同一件事。「Slowly circles around both characters revealing the enormous scale difference」在一個運動上掛了一個目的。Wan 3.0 沒有環繞半徑或鏡頭高度這種參數,而把數字寫進散文裡也不會生出參數來 —— 但「revealing the scale difference」暗示了一個夠寬的弧線和一個夠低的角度,好把兩個身體都留在畫面裡,而那正是那些數字本來要做的事。

重跑時唯一該加的是聲音。一隻在安靜空地上呼吸的龍,是一份會自己寫出來的音效設計 brief,而 Wan 3.0 是在和畫面同一次執行裡生成聲音的 —— 這意味著一句聲音指示同時也是一條時間指示。「A low slow breath under forest ambience, no music」會把那個呼吸放在一個具體的位置,而不是留給模型,而那個呼吸正是整支影片建立在上面的那個節拍。

最後,是這個模式上專門會絆倒人的那條限制:一個第一影格和一張參考圖不能出現在同一個請求裡。Wan 3.0 把關鍵影格家族和參考家族視為互斥,並且拒絕這個組合。如果你想要龍來自一張圖、遊俠來自另一張,那是參考圖生影片,而它就是這一頁上接下來的兩個範本。

這裡的一切都在圖片轉影片裡跑。

6 個問題

巨龍睜開眼睛 —— 常見問題

  • 01

    為什麼圖片轉影片的提示詞短這麼多?

    因為那個影格已經帶著主體、場景、光線和風格。留給文字的只剩下「隨時間改變的是什麼」。

  • 02

    我該描述畫面裡有什麼嗎?

    不該。在你的字和影格不一致的地方,模型會內插,而內插出來的細節是軟的。用定冠詞 —— 「the dragon」—— 去指向已經在那裡的東西。

  • 03

    我可以同時附一張參考圖和一個第一影格嗎?

    不行。Wan 3.0 會用 `InvalidParameter` 拒絕這個組合。關鍵影格和參考是兩個家族,一個請求只能用其中一個。

  • 04

    我要怎麼讓東西看起來是活的,而不是被動畫化的?

    點名一個結果,不要點名一個動作。「Leaves move from its breathing」產生的是呼吸;「the dragon breathes」產生的是一個上下起伏的胸腔。

  • 05

    我可以再加一個尾影格嗎?

    可以 —— 首影格和尾影格屬於同一個家族,可以同行。那會把提示詞變成一份「兩個固定點之間那條路線」的描述。

  • 06

    鏡頭運動需要一個速度嗎?

    這裡有一個 —— 「slowly」。給一個運動一個速度和一個目的就夠了;兩個都不給,才是一條鏡頭指示停止約束任何東西的地方。

複製它,改一層,跑起來。

每一個字元都在這一頁上。720P 的 5s 要 80 點。

由 wan-3.run 編輯團隊撰寫與維護發布於 最後更新