這段提示詞做了另外五段沒做的事:它用一個代名詞開場。不是「a young man with a camera」,就只是「he」。那之所以可能,只因為附了一個第一影格,而它也是這個庫裡對「圖片轉影片到底改變了你怎麼寫」最清楚的一次示範。
省下來的比看起來多。這顆鏡頭的文字轉影片版本,在任何事情發生之前都需要一整段:年齡、體型、衣著、他手上那台相機、那個廣場、一天中的時間、光線。這些全部已經存在於參考影格裡,而且更詳細、也沒有自相矛盾的風險。把它們刪掉不只是讓提示詞變短 —— 它拿掉了每一個「文字和畫面可能衝突」的位置,而衝突正是圖片轉影片執行變糊的地方。
第二個技巧是那個分身。這段提示詞需要同一張臉的兩個實例,而那通常是你能向一個生成模型要求的最難的東西;它的做法是從來不描述第二個:「someone standing there who appears to be himself」。那個人影是用它與一張模型已經看得見的臉之間的關係來定義的。沒有東西可以被平均,因為場上只有一個描述。對照一下你把分身的外觀寫出來會怎樣 —— 現在有兩個關於「同一個人」的描述,而模型會把它們當成兩個剛好相似的人。
那個節奏值得整套偷走。四個動詞以平靜的速度過去 —— 放下、抬頭、舉起、緩緩轉身 —— 然後一個副詞換了register:「suddenly noticing」。一支五秒的影片剛好有一個節拍的空間,而這就是花掉它的方式。那些平靜的動詞不是填充物;它們是讓那個突然的動作「讀起來是突然的」的原因。把它們拿掉,那次醒悟就沒有東西可以作為它的對照。
然後是這個範本存在要去爭論的那一行。「The camera alternates between his viewpoint and a slow push toward his stunned face」是在五秒裡要兩種不同的鏡頭覆蓋。每一種在有意義之前都需要一個時刻去立起來,而那樣的時刻沒有兩個。老實的建議是選一個,而且選那個推鏡 —— 主觀視角看到的是一座塔,推鏡看到的是一個反應,而反應才是故事。只有在你把長度拉上去的時候才保留交替。
這次跑在 Prime 上,而那買到了什麼、沒買到什麼值得再講一次。Prime 是高速版。阿里巴巴替兩檔公布的是同一份輸出規格 —— 同樣的解析度、同樣的二到三十秒範圍、每秒三十影格 —— 而 Prime 每秒貴大約一半。它比較快回來。它沒有回來一張更好的畫面,而這段提示詞也不需要那個。
缺掉的是聲音,而在這裡它比在其他範本上損失更大。這個節拍是一次醒悟,而醒悟的標準電影文法是世界安靜下來。Wan 3.0 是在和畫面同一次執行裡生成聲音的,所以像「square ambience that drops away as he turns, no music」這樣一句,會同時把畫面節拍和聲音節拍排好。留著不寫,就是讓模型自己挑,而一個從頭吵到尾的廣場,正是讀起來「什麼都沒發生」的那個版本。