P—03 / LE DRAGON OUVRE LES YEUX

Prompt Wan 3.0 image vers vidéo — décrivez le changement, pas l’image

Deux cent cinquante-quatre caractères, parce que la première image avait déjà dit tout le reste.

Le prompt le plus court de cette bibliothèque, et court pour une raison plutôt que par paresse. Une première image porte déjà la créature, la forêt, la lumière, la palette et le style — chacun de ces mots serait donc soit redondant, soit pire, un deuxième avis que le modèle doit concilier avec l’image sous ses yeux. Il ne reste à écrire que la seule chose que l’image ne peut pas contenir : ce qui bouge.

Mode
Animer une photo
Modèle
Wan 3.0
Durée
5s
Format
16:9
Résolution
720P
Son
Lit forestier, généré dans la même passe
Crédits
80

Exemple publié par Alibaba pour ce modèle — non généré sur ce site. Source : wavespeed.ai

Output reference

Un petit garde tend la main vers un énorme dragon vert allongé dans une clairière ensoleilléeVidéo
Le clip

JPG · PNG · BMP · WebP · ≤20 MB · 240–8000px · ratio ≤8:1

254 / 20,000

Le clip offert, c’est le même Wan 3.0 avec son son, plafonné à 480P · 3s, et il passe par une file partagée. Un forfait relève le plafond à 1080P et trente secondes — le palier gratuit est une résolution, pas un autre modèle.

1 CLIP OFFERT · WAN 3.0 · 480P

01 — Dedans

Un prompt, un enchaînement

Le clip à côté du prompt qui l’a produit, publié entier. Recopiez-le dans la console ci-dessus, changez ce qu’il faut, générez.

Rendu de référence

Un petit garde tend la main vers un énorme dragon vert allongé dans une clairière ensoleilléeVidéo
Le clip
Le promptthe clipWan 3.0 · Animer une photo
254 chars

Le réveil

Quatre changements et un mouvement de caméra. Aucune description de la créature, aucune description de la forêt, aucun mot de style.

The dragon slowly opens its eyes, leaves move from its breathing, glowing particles float around the forest, the ranger slowly steps forward and reaches out a hand. The camera slowly circles around both characters revealing the enormous scale difference.

6 couches

Ce que fait chaque couche

Wan 3.0 lit une seule chaîne de texte simple, mais il la lit le long de coutures. Reprenez une couche plutôt que le prompt entier — les lignes esthétique et son se transposent à presque n’importe quel sujet, et ce sont les deux que la plupart des gens écrivent le plus mal.

  1. Entity

    The dragon … the ranger

    Articles définis, aucune description. « The » dit au modèle que ce sont les choses déjà dans l’image ; « a dragon » l’aurait invité à en produire un second.

  2. Scene

    around the forest

    Trois mots, et seulement parce qu’il faut bien que les particules soient quelque part. L’image est le décor. Le redécrire est la façon dont un prompt image vers vidéo finit par se battre contre sa propre référence.

  3. Motion

    slowly opens its eyes, leaves move from its breathing, glowing particles float … steps forward and reaches out a hand

    Quatre changements, ordonnés du plus petit au plus grand, dont un — les feuilles qui bougent à cause du souffle — est un effet de second ordre. Nommer une conséquence est la façon d’obtenir que le modèle anime la cause.

  4. Aesthetic control

    The camera slowly circles around both characters revealing the enormous scale difference.

    Un mouvement avec un but attaché. « Revealing the enormous scale difference » dit au modèle à quoi sert l’orbite, ce qui en contraint le rayon et la hauteur bien mieux qu’un nombre ne le ferait.

  5. Stylization

    Non écrit — laissé au modèle.

    Absente, et à juste titre. L’image de référence est la feuille de style. Un mot de style ici entre en concurrence avec l’image, et l’image perd en général sur les bords.

  6. Sound

    Non écrit — laissé au modèle.

    Non écrite. Une forêt et un dragon qui respire suffisent au modèle pour inventer quelque chose de plausible, mais le souffle est le son qui compte et il n’a pas été nommé.

4 leviers

Faites-le vôtre

Ce qu’on peut changer sans risque. La plupart des bibliothèques ne publient que cette liste, et c’est pourquoi tant de prompts copiés reviennent moins bons que l’original.

  1. 01

    La clause de conséquence

    « Leaves move from its breathing » est la meilleure phrase de ce prompt. Elle ne dit jamais que le dragon respire — elle nomme un effet visible et laisse le modèle remonter à la cause. Cela se lit comme de la vie d’une façon que « the dragon breathes » n’atteint pas, et cela se transfère à n’importe quoi : de la vapeur qui se courbe, de la poussière qui se soulève, un tissu qui retombe.

  2. 02

    Le but posé sur la caméra

    Une orbite avec une mission énoncée. Changez ce qu’elle révèle — le visage du garde, la profondeur de la clairière, ce qu’il y a derrière le dragon — et le même verbe produit une autre trajectoire, sans que vous ayez à préciser un rayon, une hauteur ou une direction.

  3. 03

    Ce qui manque délibérément

    Pas d’écailles, pas de couleur, pas de lumière, pas d’objectif, pas de genre. Ajoutez l’un d’eux et vous demandez au modèle de concilier vos mots avec une image qui, déjà, n’est pas d’accord. La façon la plus courante dont un lancement image vers vidéo se dégrade, c’est un prompt qui décrit l’image.

  4. 04

    L’ordre des changements

    Les yeux, puis les feuilles, puis les particules, puis le garde. Du plus petit au plus grand, ce qui laisse cinq secondes se construire. Mettez le garde en premier et le réveil du dragon devient une réaction plutôt que l’événement.

Trois façons de le casser

  • Joindre des images de référence en plus d’une première image

    Wan 3.0 traite première image / dernière image et la famille des références comme mutuellement exclusives, et les mélanger est refusé net avec `InvalidParameter`. C’est de loin la façon la plus simple de construire une requête qui ne peut pas réussir, et le refus arrive après la file d’attente plutôt qu’avant.

  • Redécrire le sujet

    Écrire « a large green scaled dragon » à côté d’une image qui en montre déjà un donne au modèle deux sources pour le même fait. Là où elles diffèrent, il fera la moyenne, et le détail moyenné est exactement l’aspect mou que l’on reproche au modèle.

  • Demander une coupe

    Un lancement image vers vidéo part de votre image et reste continu avec elle. Un deuxième lieu n’a rien avec quoi être continu, donc le modèle ignore la consigne ou fait un fondu — et cinq secondes n’ont pas la place d’un fondu.

Ce qu’il fait

Ce que fait le modèle le dragon ouvre les yeux

Deux cent cinquante-quatre caractères contre un plafond de vingt mille. Ce prompt utilise environ un pour cent de ce qui lui est permis, et c’est la chose la mieux écrite de cette bibliothèque.

La raison, c’est qu’animer une photo est un autre travail que le texte vers vidéo, et que la plupart des gens l’écrivent comme si c’était le même travail avec une image jointe. En texte vers vidéo, le prompt est l’unique source de vérité : il doit porter l’entité, le décor, le mouvement, l’esthétique et le style. En image vers vidéo, l’image porte déjà l’entité, le décor, l’esthétique et le style — avec bien plus de détail que la prose ne peut, et sans ambiguïté. Ce que l’image ne peut pas porter, c’est le temps. Le prompt a donc exactement une mission : dire ce qui change.

Regardez ce que ce texte refuse de faire. Il ne dit jamais que le dragon est vert, ou grand, ou écailleux. Il ne décrit pas la forêt au-delà des trois mots nécessaires pour situer les particules. Il ne donne ni objectif, ni étalonnage, ni genre, ni ambiance. Chacun de ces éléments aurait été un deuxième avis sur une question déjà réglée, et quand un prompt et une image de référence ne sont pas d’accord, le modèle ne désigne pas un gagnant — il interpole. Le détail interpolé est mou, et le détail mou est ce que les gens veulent dire quand ils trouvent qu’un lancement « fait IA ».

Les quatre changements sont ordonnés du plus petit au plus grand : les yeux, les feuilles, les particules, le garde qui entre. Cet ordre est ce qui fait que cinq secondes donnent l’impression de se construire plutôt que de tout arriver d’un coup. C’est aussi, discrètement, une montée d’échelle — une paupière, puis le feuillage, puis l’air, puis une personne qui traverse l’image — c’est-à-dire le même mouvement structurel que le prompt des échecs opère avec les expressions.

La meilleure ligne est la deuxième. « Leaves move from its breathing » ne demande jamais au dragon de respirer. Elle nomme une conséquence visible et laisse la cause implicite, ce qui force le modèle à produire la cause pour justifier l’effet. C’est une technique fiable et elle se généralise : de la vapeur qui se courbe au-dessus d’une casserole, de la poussière qui se soulève d’une route, un manteau qui retombe quand quelqu’un s’arrête. Nommer l’effet vous donne le mouvement ; nommer le mouvement vous donne une animation du mot.

La ligne de caméra fait la même chose dans un autre registre. « Slowly circles around both characters revealing the enormous scale difference » attache un but à un mouvement. Wan 3.0 n’a aucun paramètre de rayon d’orbite ni de hauteur de caméra, et écrire des nombres dans la prose n’en créerait aucun — mais « revealing the scale difference » implique un arc assez large et un angle assez bas pour tenir les deux corps dans l’image, ce à quoi ces nombres auraient servi.

La seule chose à ajouter à la relance, c’est le son. Un dragon qui respire dans une clairière silencieuse est un brief de conception sonore qui s’écrit tout seul, et Wan 3.0 génère l’audio dans la même passe que l’image — ce qui veut dire qu’une phrase d’audio est aussi une indication de rythme. « A low slow breath under forest ambience, no music » aurait placé le souffle à un endroit précis au lieu de le laisser au modèle, et le souffle est le temps sur lequel tout le clip est bâti.

Enfin, la contrainte qui piège sur ce mode en particulier : une première image et une image de référence ne peuvent pas voyager dans la même requête. Wan 3.0 traite la famille des images clés et la famille des références comme mutuellement exclusives et refuse la combinaison. Si vous voulez le dragon d’une image et le garde d’une autre, c’est de l’image de référence, et ce sont les deux modèles suivants de cette page.

Tout ici s’exécute dans animer une photo.

6 questions

Le dragon ouvre les yeux — questions fréquentes

  • 01

    Pourquoi un prompt image vers vidéo est-il tellement plus court ?

    Parce que l’image porte déjà le sujet, le décor, la lumière et le style. Il ne reste au texte que ce qui change au fil du temps.

  • 02

    Faut-il décrire ce qu’il y a sur l’image ?

    Non. Là où vos mots et l’image divergent, le modèle interpole, et le détail interpolé est mou. Utilisez des articles définis — « the dragon » — pour désigner ce qui est déjà là.

  • 03

    Puis-je joindre une image de référence en plus d’une première image ?

    Non. Wan 3.0 refuse cette combinaison avec `InvalidParameter`. Images clés et références sont deux familles et une requête ne peut en utiliser qu’une.

  • 04

    Comment faire pour que quelque chose paraisse vivant plutôt qu’animé ?

    Nommez une conséquence au lieu d’une action. « Leaves move from its breathing » produit une respiration ; « the dragon breathes » produit une poitrine qui monte et descend.

  • 05

    Puis-je ajouter aussi une dernière image ?

    Oui — première image et dernière image appartiennent à la même famille et peuvent voyager ensemble. Le prompt devient alors la description du trajet entre deux points fixes.

  • 06

    Le mouvement de caméra a-t-il besoin d’une vitesse ?

    Il en a une ici — « slowly ». Donner à un mouvement une vitesse et un but suffit ; ne lui donner ni l’un ni l’autre est le moment où une indication de caméra cesse de contraindre quoi que ce soit.

Copiez-le, changez une couche, lancez-le.

Chaque caractère est sur cette page. 5s en 720P coûte 80 crédits.

Écrit et maintenu par l’équipe éditoriale de wan-3.runPublié le Mis à jour le