P—10 / DE LA LYCÉENNE À L’ARMURE

Prompt Wan 3.0 pour un changement d’échelle — de la rue au pâté de maisons

La même personne en trois échelles de plan, et le prompt dit quelle échelle porte chaque temps.

Quinze secondes suffisent pour trois échelles de plan, et obtenir trois échelles de plan est un autre problème qu’obtenir trois temps. Wan 3.0 n’a ni syntaxe de coupe ni liste de plans : la seule façon de changer de découpe en cours de clip est donc de l’écrire comme quelque chose que la caméra fait, ou comme un changement de ce que l’image contient. Ce prompt fait les deux, et c’est l’exemple le plus net de la page pour passer d’un plan large à un très gros plan puis en ressortir, sans un seul nom de champ.

Mode
Texte vers vidéo
Modèle
Wan 3.0
Durée
15s
Format
16:9
Résolution
720P
Son
Rue, servomoteurs, puis un grondement sourd
Crédits
240

Rendu de référence — non généré sur ce site. Prompt relu à partir des images, non cité depuis la génération. Source : wan30.co

Output reference

Une armure rose tire un rayon sur une brute cuirassée verte à travers une esplanade de bétonVidéo
Le clip
1,198 / 20,000

Le clip offert, c’est le même Wan 3.0 avec son son, plafonné à 480P · 3s, et il passe par une file partagée. Un forfait relève le plafond à 1080P et trente secondes — le palier gratuit est une résolution, pas un autre modèle.

1 CLIP OFFERT · WAN 3.0 · 480P

01 — Dedans

Un prompt, un enchaînement

Le clip à côté du prompt qui l’a produit, publié entier. Recopiez-le dans la console ci-dessus, changez ce qu’il faut, générez.

Rendu de référence

Une armure rose tire un rayon sur une brute cuirassée verte à travers une esplanade de bétonVidéo
Le clip
Le promptthe clipWan 3.0 · Texte vers vidéo
1,198 chars

L’équipement

Quatre temps, chacun portant sa propre échelle de plan, et une indication de couleur qui est en réalité une indication de contraste.

A teenage girl in an oversized grey sweater and a pleated skirt walks across a campus forecourt in the middle of the day, other students in uniform passing without looking at her; her right arm is a glossy pink prosthetic. Then she stops and armour plates unfold from that arm and travel across her body until she is inside a full pink mech suit, the visor closing last. After that the camera pushes to an extreme close-up of her face behind the glass, calm, a lollipop stick at the corner of her mouth. Finally the frame opens out into a wide concrete plaza where a green-skinned armoured brute twice her height is coming at her, she plants both feet and fires a hot pink beam from the core in her chest, the blast throws the brute back through the paving in a wall of dust, and the shot holds on her standing alone in the rubble. Anime realism, bright overcast daylight, saturated candy pink against concrete grey, glossy moulded plastic and painted metal, handheld at street level for the walk and locked off for the stand-off, shallow depth of field on the close-up, no lens flare. Street noise and footsteps first, then servo whine and plate locks, then a low rumble under the brute, no music.

6 couches

Ce que fait chaque couche

Wan 3.0 lit une seule chaîne de texte simple, mais il la lit le long de coutures. Reprenez une couche plutôt que le prompt entier — les lignes esthétique et son se transposent à presque n’importe quel sujet, et ce sont les deux que la plupart des gens écrivent le plus mal.

  1. Entity

    A teenage girl in an oversized grey sweater and a pleated skirt … her right arm is a glossy pink prosthetic

    La prothèse est plantée dans la première phrase pour que la transformation ait d’où venir. Sans elle, l’armure arrive de nulle part et le temps se lit comme une coupe vers un autre personnage.

  2. Scene

    a campus forecourt in the middle of the day, other students in uniform passing without looking at her

    Les élèves indifférents sont le décor. Ils établissent que tout est ordinaire avant que quoi que ce soit ne cesse de l’être, c’est-à-dire toute l’exposition faite en une subordonnée.

  3. Motion

    armour plates unfold from that arm and travel across her body until she is inside a full pink mech suit, the visor closing last

    « The visor closing last » est une indication d’ordre à l’intérieur d’un seul temps. Elle donne à la transformation une ligne d’arrivée, ce qui l’empêche de ressembler à un fondu entre deux costumes.

  4. Aesthetic control

    handheld at street level for the walk and locked off for the stand-off, shallow depth of field on the close-up, no lens flare

    Le comportement de caméra assigné temps par temps plutôt qu’au clip. C’est ainsi qu’on obtient trois échelles de plan d’un modèle sans syntaxe de coupe : attachez la découpe au moment, pas à la requête.

  5. Stylization

    Anime realism, bright overcast daylight, saturated candy pink against concrete grey, glossy moulded plastic and painted metal

    L’indication de couleur nomme les deux côtés du contraste. Demander du rose seul donne une image teintée de rose ; demander du rose contre du gris donne du rose qui se lit comme du rose.

  6. Sound

    Street noise and footsteps first, then servo whine and plate locks, then a low rumble under the brute, no music.

    Le mot « then » apparaît deux fois dans la couche de son, en miroir exact de la couche d’image. L’audio est généré dans la même passe : une conduite écrite deux fois est une conduite que le modèle a deux fois plus de chances de tenir.

4 leviers

Faites-le vôtre

Ce qu’on peut changer sans risque. La plupart des bibliothèques ne publient que cette liste, et c’est pourquoi tant de prompts copiés reviennent moins bons que l’original.

  1. 01

    Les trois échelles de plan

    Large, très gros plan, large à nouveau. Elles sont écrites « walks across », « the camera pushes to an extreme close-up » et « the frame opens out into a wide ». Ces trois formulations sont tout le vocabulaire de découpe dont vous avez besoin dans un modèle sans liste de plans.

  2. 02

    Le détail planté

    Une prothèse rose à la première phrase, une armure rose à la deuxième. Toute transformation se lit mieux quand la chose dont elle naît est visible auparavant, et cela coûte six mots.

  3. 03

    La paire de couleurs

    Rose bonbon contre gris béton. Nommer ce contre quoi la couleur se pose vaut plus que nommer la couleur deux fois, et cela se transfère à toutes les indications de palette que vous écrirez.

  4. 04

    La sucette

    Un petit détail précis et légèrement déplacé dans le gros plan. C’est la seule chose du prompt qui ne fait pas de travail structurel, et c’est pourquoi le gros plan se lit comme un personnage plutôt que comme un casque.

Trois façons de le casser

  • Demander une coupe

    Il n’y a pas de syntaxe de coupe. « Cut to » et « next shot » sont lus comme des mots, et le modèle fait de son mieux avec — en général un filé ou un fondu. Changez de découpe en disant ce que fait la caméra ou ce que l’image contient désormais.

  • Décrire le visage en détail

    Wan 3.0 n’a aucun mécanisme d’identité indépendant de la graine en mode texte : un visage précisé par des adjectifs dérivera quand même entre le temps de la rue et le gros plan. Si le même visage doit tenir à travers les échelles de plan, c’est une image de référence et un autre mode.

  • Mettre une réplique entre guillemets

    Si vous ajoutez du dialogue ici — et le gros plan est l’endroit évident — écrivez les mots exacts et attachez-les à quelqu’un qui est à l’image. Une réplique que personne de visible ne prononce n’a pas de bouche avec quoi se synchroniser, et c’est ainsi qu’une réplique finit par sonner comme une narration.

Ce qu’il fait

Ce que fait le modèle de la lycéenne à l’armure

Le problème intéressant dans ce prompt est la découpe, pas l’histoire. Trois échelles de plan en quinze secondes, dans un modèle qui n’a aucun moyen d’exprimer une coupe.

Tous les modèles vidéo à protocole de champs — ceux qui publient un schéma de liste de plans, une grammaire de code temporel, des balises d’éléments entre chevrons — rendent la découpe explicite. Wan 3.0 ne fait rien de tout cela. Il lit une chaîne ordinaire, et tout ce qui ressemble à un repère de plan est du contenu à représenter plutôt que de la structure à analyser. La question est donc de savoir quel anglais ordinaire produit de façon fiable un changement d’échelle de plan, et la réponse se révèle étonnamment étroite : soit vous dites ce que fait la caméra, soit vous dites ce que l’image contient désormais.

Ce prompt utilise les deux. « The camera pushes to an extreme close-up of her face behind the glass » est le premier type — une consigne à la caméra, avec l’échelle de destination nommée. « Finally the frame opens out into a wide concrete plaza where a green-skinned armoured brute twice her height is coming at her » est le second — on ne dit pas à l’image de bouger, on lui dit ce qu’il y a dedans, et un corps deux fois plus grand qu’elle avec de la place pour charger ne peut pas tenir dans un gros plan. Les deux fonctionnent. Le second est plus robuste, parce qu’il contraint la composition par le contenu plutôt que par un terme que le modèle doit interpréter.

Ce qui ne fonctionne pas, c’est de demander une coupe. « Cut to », « next shot », « then we see » sont tous lus comme de la prose. Le modèle en fait quelque chose, et ce quelque chose est en général un filé ou un fondu, parce que ce sont les transitions qui existent à l’intérieur d’images continues. Si vous voulez la sensation d’une coupe, les options honnêtes sont d’écrire un changement de contenu assez fort pour que le modèle doive sauter, ou de générer deux clips et de les monter vous-même.

La fin est écrite, et sur une requête de quinze secondes ce n’est pas facultatif. « The blast throws the brute back through the paving in a wall of dust, and the shot holds on her standing alone in the rubble » assigne le dernier temps et nomme l’image sur laquelle cela s’arrête. Omettez-la et le dernier tiers d’un clip Wan 3.0 part vers ce que le modèle imagine qu’un combat devient, c’est-à-dire de façon fiable un lent recul. Remarquez aussi d’où vient le rayon : du cœur dans sa poitrine, pas d’une main. Une arme a besoin d’une origine, sinon le modèle met la lumière là où la pose le permet, et un émetteur nommé une fois dans le prompt est un émetteur qui reste au même endroit pour le reste du plan.

La deuxième chose à étudier est la couche de son, écrite en miroir de la couche d’image. Bruit de rue, puis servomoteurs, puis grondement — trois sons dans le même ordre que les trois temps, avec le même connecteur. Sur un modèle qui génère audio et image en une passe, ce n’est pas de la décoration ; c’est un énoncé second et indépendant de la conduite, formulé dans une autre modalité. Quand les deux concordent, le rythme se resserre sensiblement. C’est l’astuce de fiabilité la moins chère disponible sur les longues requêtes Wan 3.0, et elle n’est presque dans le prompt de personne.

L’indication de couleur mérite sa propre note, parce que c’est la clause la plus transférable d’ici. « Saturated candy pink against concrete grey » nomme les deux côtés. Un prompt qui ne demande que du rose renvoie souvent une image rose partout — la lumière, les murs, l’étalonnage — auquel point plus rien n’est rose, parce que le rose est une relation. Nommer le fond contre lequel une couleur se pose est la façon d’obtenir une couleur qui se lit. Cela fonctionne pour toute indication de palette et mérite d’en faire une habitude.

Enfin, la réserve honnête qui vaut pour chaque modèle de ce groupe : le clip a été publié sans prompt, et ce texte a été écrit en regardant les images. Il vous donnera un clip de ce genre. S’il vous faut que ce personnage précis survive à un changement d’échelle de plan, le mode texte est le mauvais outil quelle que soit la façon d’écrire le prompt — c’est à cela que servent le mode référence et une image de personnage, et il y en a trois exemples ailleurs dans cette bibliothèque.

Tout ici s’exécute dans texte vers vidéo.

6 questions

De la lycéenne à l’armure — questions fréquentes

  • 01

    Comment changer d’échelle de plan en cours de clip sans coupe ?

    Dites ce que fait la caméra — « the camera pushes to an extreme close-up » — ou dites ce que l’image contient désormais. Un corps deux fois plus grand que votre personnage avec de la place pour charger ne peut pas tenir dans un gros plan : le nommer force le plan large.

  • 02

    Wan 3.0 comprend-il « cut to » ?

    Seulement comme des mots. Il n’y a pas de syntaxe de coupe ; le modèle lit l’expression et vous donne en général un filé ou un fondu. Les vraies coupes viennent de la génération de deux clips que vous montez.

  • 03

    Le visage restera-t-il le même sur les trois plans ?

    À peu près, pas de façon fiable. Le mode texte n’a pas de mécanisme d’identité. Si un visage précis doit survivre à un changement d’échelle, utilisez le mode référence avec une image de personnage.

  • 04

    D’où devrait partir un rayon ou une lueur de tir ?

    De quelque part que vous nommez. « From the core in her chest » fixe l’émetteur pour tout le plan ; ne pas le dire laisse le modèle accrocher la lumière au membre que la pose rend commode, et elle bougera.

  • 05

    Pourquoi écrire le son dans le même ordre que l’image ?

    Parce que Wan 3.0 génère les deux en une passe. Une conduite énoncée deux fois, une fois visuellement et une fois sonorement, tient mieux qu’une conduite énoncée une seule fois.

  • 06

    Est-ce un vrai exemple Wan 3.0 ?

    Le clip est un rendu publié ailleurs sans prompt joint. Le prompt ci-dessus a été reconstruit à partir des images, ce que dit la fiche et ce que fait l’outil vidéo vers prompt de ce site pour vos propres clips.

Copiez-le, changez une couche, lancez-le.

Chaque caractère est sur cette page. 15s en 720P coûte 240 crédits.

Écrit et maintenu par l’équipe éditoriale de wan-3.runPublié le Mis à jour le