P—04 / 鐘樓下的那個男人

Wan 3.0 圖片轉影片提示詞 —— 一個沒有半句對白的故事鉤子

提示詞叫他「he」,然後就再也沒有描述過他。那個影格已經把人介紹完了。

一個遊客放下相機、抬頭看向一座鐘樓,然後看見自己站在上面。整支跑五秒、沒有對白,而且從頭到尾沒有描述過自己的主體 —— 它用一個代名詞開場,其餘全部交給參考影格。它也是這個庫裡唯一一段要求鏡頭在兩個視點之間交替的提示詞,而那超出了五秒能從容做到的範圍。

模式
圖片轉影片
模型
Prime
長度
5s
比例
16:9
解析度
720P
音訊
廣場環境音,在同一次執行裡生成
點數
120

阿里巴巴為這個模型公布的示例 —— 不是在本站生成的。 來源:wavespeed.ai

Output reference

一個拿著相機的男人站在熱鬧的歐洲廣場上,望向遠處一座鐘樓影片
這支片子

JPG · PNG · BMP · WebP · ≤20 MB · 240–8000px · ratio ≤8:1

374 / 20,000

免費那支就是同一個 Wan 3.0,聲音也有,上限是 480P · 3s,走的是共用佇列。方案能把上限抬高到 1080P 和三十秒 —— 免費檔是一個解析度,不是另一個模型。

1 支免費 · WAN 3.0 · 480P

01 —— 內部

一條提示詞,一套流程

片子擺在做出它的那條提示詞旁邊,整條印出來。把它複製進上面的控制台,改你需要改的,然後生成。

參考產出

一個拿著相機的男人站在熱鬧的歐洲廣場上,望向遠處一座鐘樓影片
片子
這條提示詞the clipWan 3.0 Prime · 圖片轉影片
374 chars

分身

三個動作、一次揭曉,以及一條在五秒裡要兩個視點的鏡頭指示。

He lowers the camera, looks at the busy square around him, then raises it again to compare the scene. He slowly turns toward a clock tower visible in the distance, suddenly noticing someone standing there who appears to be himself. The camera alternates between his viewpoint and a slow push toward his stunned face. Urban suspense, subtle sci-fi hook, clear story movement.

6 層

每一層在做什麼

Wan 3.0 讀的是一整條白話字串,但它是順著接縫讀的。拿走一層,而不是整條提示詞 —— 美學和聲音那兩行幾乎能換到任何主體上,而它們正是大多數人寫得最差的兩行。

  1. Entity

    He … someone standing there who appears to be himself

    一個代名詞,加一個只靠「與他的關係」定義的分身。臉由影格提供,而第二個人影繼承它 —— 那比把同一個人描述兩次更便宜也更可靠。

  2. Scene

    the busy square around him … a clock tower visible in the distance

    兩者都已經在影格裡。點名它們是為了指向它們,不是為了把它們蓋出來,所以兩個都沒有形容詞。

  3. Motion

    lowers the camera … raises it again … slowly turns toward a clock tower … suddenly noticing

    用 `then` 排序,而那是 Wan 3.0 唯一有的排序文法。注意速度的對比:三個慢動作加一個突然的,而那個突然的就是節拍。

  4. Aesthetic control

    The camera alternates between his viewpoint and a slow push toward his stunned face.

    這裡最有野心、也最弱的一行。視點交替意味著至少兩次切,而五秒給每一次不到兩秒去立起來。

  5. Stylization

    Urban suspense, subtle sci-fi hook, clear story movement

    `subtle` 在做真正的工作 —— 它讓那個分身保持是一個站在塔上的人,而不是一團發光的特效。「Clear story movement」則比較接近一個願望,不太像一條指示。

  6. Sound

    沒寫 —— 留給模型。

    沒寫。一個廣場交給模型是安全的,但這裡的節拍是一次醒悟,而環境音突然掉下來,是這件事在每一部做過它的電影裡被讀出來的方式。

4 個可調項

把它變成你的

哪些改動是安全的。多數庫只發布這一份清單,這也是為什麼那麼多複製來的提示詞跑出來比原作還差。

  1. 01

    那個代名詞

    用「he」開場就是重點。影格已經把他介紹過了;提示詞從場景中途開始,只描述他做了什麼。拿你自己的第一影格試一次 —— 把所有關於「主體是誰」的字全部刪掉,看看提示詞短了多少。

  2. 02

    速度的對比

    放下、抬頭、舉起、緩緩轉身 —— 然後是「suddenly noticing」。四個平靜的動詞讓一個突然的落下來。這是給一支五秒影片一個節拍最便宜的方法,代價是一個副詞。

  3. 03

    關係式的分身

    「Someone standing there who appears to be himself」不用描述就拿到了同一張臉的第二個實例。任何時候你需要兩個必須一致的東西,就用「與第一個的關係」去定義第二個,不要把描述再寫一遍。

  4. 04

    視點的交替

    如果這次執行回來很糊,這就是該砍掉的那一行。挑一個:要嘛我們在他眼睛後面,要嘛我們推向他的臉。在五秒上,選一個比交替好,而推向臉的那一顆,是有反應在裡面的那一顆。

三種把它弄壞的方式

  • 兩個視點都留著、還要再縮短

    兩個視點需要兩個立起來的時刻。五秒以下沒有足夠時間讓第二個讀得出來,所以模型會用「丟掉一個」來解決 —— 而它不一定丟掉你會丟的那一個。

  • 去描述那個分身

    你一旦給塔上那個人影它自己的描述,它就變成另一個剛好長得像的人。「Appears to be himself」才是讓它成為同一張臉的東西;一張服裝清單則會把它弄壞。

  • 把科幻感放大

    「Subtle sci-fi hook」是把這顆鏡頭留在現實世界裡的那條約束。拿掉 `subtle`,或是加上一道光暈、一陣閃爍、一個傳送門,一個懸疑節拍就變成一個視覺特效 —— 那是一個好生成得多、也難看得多的東西。

它做什麼

鐘樓下的那個男人 這個範本做什麼

這段提示詞做了另外五段沒做的事:它用一個代名詞開場。不是「a young man with a camera」,就只是「he」。那之所以可能,只因為附了一個第一影格,而它也是這個庫裡對「圖片轉影片到底改變了你怎麼寫」最清楚的一次示範。

省下來的比看起來多。這顆鏡頭的文字轉影片版本,在任何事情發生之前都需要一整段:年齡、體型、衣著、他手上那台相機、那個廣場、一天中的時間、光線。這些全部已經存在於參考影格裡,而且更詳細、也沒有自相矛盾的風險。把它們刪掉不只是讓提示詞變短 —— 它拿掉了每一個「文字和畫面可能衝突」的位置,而衝突正是圖片轉影片執行變糊的地方。

第二個技巧是那個分身。這段提示詞需要同一張臉的兩個實例,而那通常是你能向一個生成模型要求的最難的東西;它的做法是從來不描述第二個:「someone standing there who appears to be himself」。那個人影是用它與一張模型已經看得見的臉之間的關係來定義的。沒有東西可以被平均,因為場上只有一個描述。對照一下你把分身的外觀寫出來會怎樣 —— 現在有兩個關於「同一個人」的描述,而模型會把它們當成兩個剛好相似的人。

那個節奏值得整套偷走。四個動詞以平靜的速度過去 —— 放下、抬頭、舉起、緩緩轉身 —— 然後一個副詞換了register:「suddenly noticing」。一支五秒的影片剛好有一個節拍的空間,而這就是花掉它的方式。那些平靜的動詞不是填充物;它們是讓那個突然的動作「讀起來是突然的」的原因。把它們拿掉,那次醒悟就沒有東西可以作為它的對照。

然後是這個範本存在要去爭論的那一行。「The camera alternates between his viewpoint and a slow push toward his stunned face」是在五秒裡要兩種不同的鏡頭覆蓋。每一種在有意義之前都需要一個時刻去立起來,而那樣的時刻沒有兩個。老實的建議是選一個,而且選那個推鏡 —— 主觀視角看到的是一座塔,推鏡看到的是一個反應,而反應才是故事。只有在你把長度拉上去的時候才保留交替。

這次跑在 Prime 上,而那買到了什麼、沒買到什麼值得再講一次。Prime 是高速版。阿里巴巴替兩檔公布的是同一份輸出規格 —— 同樣的解析度、同樣的二到三十秒範圍、每秒三十影格 —— 而 Prime 每秒貴大約一半。它比較快回來。它沒有回來一張更好的畫面,而這段提示詞也不需要那個。

缺掉的是聲音,而在這裡它比在其他範本上損失更大。這個節拍是一次醒悟,而醒悟的標準電影文法是世界安靜下來。Wan 3.0 是在和畫面同一次執行裡生成聲音的,所以像「square ambience that drops away as he turns, no music」這樣一句,會同時把畫面節拍和聲音節拍排好。留著不寫,就是讓模型自己挑,而一個從頭吵到尾的廣場,正是讀起來「什麼都沒發生」的那個版本。

這裡的一切都在圖片轉影片裡跑。

6 個問題

鐘樓下的那個男人 —— 常見問題

  • 01

    一段提示詞真的可以用「he」開頭嗎?

    在圖片轉影片裡,可以。參考影格已經把主體介紹過了,所以文字可以從場景中途開始,只描述他做了什麼。

  • 02

    我要怎麼在同一顆鏡頭裡拿到兩個同樣的人?

    用第二個與第一個的關係去定義它 ——「someone who appears to be himself」—— 不要再描述一次。同一個人的兩個描述,會產生兩個人。

  • 03

    為什麼那個視點交替沒有完全落地?

    兩種鏡頭覆蓋需要兩個立起來的時刻,而五秒只有一個。挑那顆有反應在裡面的,或是把長度拉上去。

  • 04

    風格那一行裡的 `subtle` 在做什麼?

    它把科幻留在現實世界裡。沒有它,那個分身通常會帶著一道光暈或一陣閃爍抵達 —— 那比較好生成,也遠遠沒那麼令人不安。

  • 05

    這種鏡頭值得用 Prime 嗎?

    只有在你想早一點拿到的時候。Prime 是高速檔,公布的輸出規格完全相同,每秒大約貴一半。

  • 06

    我要怎麼把它延長到五秒以上?

    加節拍,並且把順序寫出來 —— then、after that、finally —— 而且說明它怎麼結束。一支沒有寫結尾的長 Wan 3.0 影片,會自己編一個。

複製它,改一層,跑起來。

每一個字元都在這一頁上。720P 的 5s 要 120 點。

由 wan-3.run 編輯團隊撰寫與維護發布於 最後更新