이 프롬프트는 나머지 다섯이 하지 않는 것을 합니다. 대명사로 시작합니다. "A young man with a camera"가 아니라 그냥 "he". 첫 프레임이 붙어 있기 때문에만 가능한 일이고, 사진으로 동영상이 글쓰기를 실제로 어떻게 바꾸는지 이 라이브러리에서 가장 선명하게 보여 주는 대목입니다.
절약되는 양은 보이는 것보다 큽니다. 이 숏의 텍스트로 동영상 판본이라면 무엇이 일어나기 전에 한 문단이 필요합니다. 나이, 체형, 옷, 그가 든 카메라, 광장, 시각, 빛. 그 전부가 레퍼런스 프레임에 이미 있습니다. 더 자세하게, 스스로와 어긋날 위험 없이. 그걸 지우는 것은 프롬프트를 짧게 만드는 데 그치지 않습니다 — 말과 그림이 충돌할 수 있는 자리를 전부 없애는 것이고, 충돌이야말로 사진으로 동영상 런이 물러지는 자리입니다.
두 번째 기법은 분신입니다. 이 프롬프트는 한 얼굴의 두 사례가 필요한데, 보통은 생성 모델에게 요구하기 가장 어려운 것입니다. 그리고 두 번째를 한 번도 묘사하지 않음으로써 거기에 도달합니다. "Someone standing there who appears to be himself". 그 인물은 모델이 이미 볼 수 있는 얼굴과의 관계로 정의됩니다. 평균 낼 것이 없습니다. 판에 올라온 묘사가 하나뿐이니까요. 분신의 외모를 적어 넣었을 때 무슨 일이 생기는지와 견줘 보세요 — 이제 한 사람이어야 할 것에 대한 묘사가 둘이 되고, 모델은 그것을 비슷하게 생긴 두 사람으로 다룹니다.
박자 운용은 통째로 훔칠 값어치가 있습니다. 동사 넷이 차분한 속도로 지나가고 — 내리고, 보고, 올리고, 천천히 돌아서고 — 그다음 부사 하나가 음역을 바꿉니다. "Suddenly noticing". 5초짜리 클립에는 박자가 정확히 하나 들어갈 자리가 있고, 이렇게 쓰는 것입니다. 차분한 동사들은 채우기가 아닙니다. 그것들이 갑작스러운 것을 갑작스러운 것으로 읽히게 만듭니다. 그것들을 빼면 깨달음은 무엇으로부터의 변화인지를 잃습니다.
그리고 이 템플릿이 따지려고 존재하는 줄이 있습니다. "The camera alternates between his viewpoint and a slow push toward his stunned face"는 5초 안에 서로 다른 커버리지 둘을 요구합니다. 각각은 의미를 갖기 전에 세워질 순간이 필요하고, 그런 순간이 둘 있지 않습니다. 정직한 조언은 고르라는 것이고, 미는 쪽을 고르라는 것입니다 — 시점 숏은 탑을 보여 주고, 미는 숏은 반응을 보여 주며, 이야기는 반응입니다. 교차는 길이를 올릴 때만 남기세요.
이건 Prime으로 돌렸고, 그게 무엇을 사 주고 무엇을 안 사 주는지 다시 말할 값어치가 있습니다. Prime은 고속 모델입니다. 알리바바는 두 등급에 같은 출력 사양을 공개합니다 — 같은 해상도, 같은 2~30초 범위, 초당 30프레임 — 그리고 Prime의 초당 값을 절반쯤 더 매깁니다. 더 빨리 돌아왔습니다. 더 나은 그림이 돌아온 것은 아니고, 이 프롬프트에 Prime을 요구하는 부분은 없었습니다.
빠진 것은 소리이고, 여기서는 다른 템플릿들보다 손실이 큽니다. 박자가 깨달음이고, 깨달음의 표준 영화 문법은 세계가 조용해지는 것입니다. Wan 3.0은 오디오를 그림과 같은 패스에서 만들므로 "square ambience that drops away as he turns, no music" 같은 문장 하나가 소리의 박자뿐 아니라 그림의 박자까지 배치했을 것입니다. 안 썼다는 것은 모델이 골랐다는 뜻이고, 계속 붐비기만 하는 광장은 아무 일도 일어나지 않은 것으로 읽히는 판본입니다.