Wan 3.0 en mode image de référence
Téléversez le visage, la veste, le produit, la voix — Wan 3.0 prend les quatre et garde chacun d’eux identique pendant trente secondes, dans une scène qui n’a jamais existé. Jusqu’à dix images, cinq clips et cinq pistes audio dans une seule génération.
Trois lancements Wan 3.0 publiés, puis toutes les autres idées du site · Essayer charge le prompt
16:9 · 720P · 5 sCite Image 1, et la verrouille
Ce que le mode image de référence
garde identique
Vous téléversez de la matière et Wan 3.0 construit une scène qui lui obéit.
Wan 3.0 en mode image de référence prend jusqu’à vingt fichiers — dix images, cinq clips vidéo et cinq pistes audio — et traite chacun comme une contrainte plutôt que comme un point de départ. Ces visages, vêtements, accessoires, voix et rapports spatiaux restent cohérents tout au long d’une seule prise d’au plus trente secondes, avec l’audio généré dans la même passe.
- Images · clips · audio
- 10 + 5 + 5
- Fichiers en une requête
- 20
- N’importe quelle seconde entière
- 2–30 s
- 30 fps, le son compris
- 480P / 720P / 1080P
Images · clips · audio
Fichiers en une requête
N’importe quelle seconde entière
30 fps, le son compris
- Ce n’est pas un logiciel de montage — il bâtit une scène nouvelle plutôt que d’en modifier une ancienne
- Ce n’est pas un échange de visages, ni un moyen de mettre quelqu’un dans une vidéo sans son accord
- Pas de première image à côté des références — ces deux familles s’excluent
Pourquoi Wan 3.0 refuse des références et une première image ensemble
Wan 3.0 a deux familles d’entrées média, et une même requête ne peut en utiliser qu’une seule.
reference_imageFamille référenceCette pagereference_image·reference_video·reference_audio·file·link— de la matière dont le modèle s’inspire pour bâtir une scène qui n’a jamais existé.
first_frameFamille image d’ouvertureAnimer une photofirst_frame·last_frame— une ouverture exacte, et éventuellement une fin exacte, par lesquelles la sortie doit passer.
Envoyez-en une de chaque famille et Wan 3.0 refuse la requête tout net plutôt que de désigner un gagnant — c’est pourquoi cette page désactive les entrées d’images d’ouverture dès que vous ajoutez une référence. Le refus se produit chez Alibaba, après votre mise en file d’attente : l’attraper ici coûte une seconde au lieu d’une place dans la file.
La famille qu’il vous faut découle de la question que vous posez. « Commencer exactement sur cette photographie » relève de l’image d’ouverture, et c’est Animer une photo. « Garder ce visage, mais quelque part où il n’a jamais été » relève de la référence, et c’est cette page. Si le sujet dérive à l’intérieur d’un même clip plutôt qu’entre deux plans, le jeu de références n’est pas la solution — cohérence des personnages l’est.
Combien de références
Wan 3.0 accepte
Trois sortes de matière entrent dans Wan 3.0, chacune avec son plafond : dix images, cinq clips vidéo, cinq pistes audio.
⚠️ Wan 3.0 facture les secondes des clips de référence en plus de vos secondes de sortie, et les deux réunies ne peuvent pas dépasser trente. Six secondes de référence plus vingt secondes de sortie font vingt-six secondes facturées et une requête valide ; six plus vingt-huit, non. Les images, l’audio, les documents et les liens n’ajoutent rien.
- Images de référence
- ≤ 10 · ≤ 20 Mo chacune · JPEG · JPG · PNG (sans alpha) · BMP · WEBP240–8 000 px par côté, format jusqu’à 8:1
- Officiel
- Clip de référence
- ≤ 5 clips · 1–15 s chacun · 15 s au total, tous clips confondus · mp4 · mov · ≤ 100 Mo chacun
- Officiel
- Le tout réuni
- 20, soit la somme de ces trois-làAlibaba fixe une limite par type. Il n’y a pas de plafond distinct sur le total — cette ligne est une addition, pas un chiffre publié.
- Officiel
Cinq emplacements vidéo à quinze secondes chacun feraient soixante-quinze secondes, et le plafond est de quinze — sur la vidéo, ce n’est donc jamais le nombre d’emplacements qui contraint, c’est le cumul. Le compteur au-dessus de la zone de prompt suit les deux, en secondes et en crédits, avant que vous n’appuyiez sur Générer.
Ce que Wan 3.0 maintient vraiment
Alibaba énumère quatre dimensions de cohérence dans Wan 3.0. Il vaut la peine de les connaître séparément, parce que lorsque quelque chose dérive, c’est en général l’une d’elles et pas les quatre.
Le sujet
Ce que la caméra vise.
charactersPersonnages
Traits du visage, coiffure et couleur, morphologie, vêtements, accessoires.
Assez fin pour que les sangles d’une veste survivent à une scène de combat.
propsAccessoires
Apparence sous plusieurs angles, structure des pièces, logos, détail des matières.
Le même flacon, d’un plan à l’autre, étiquette intacte.
La scène
Tout ce qui entoure le sujet.
spaceEspace
Placement des personnages et point de vue de la caméra, avec des rapports spatiaux qui restent justes.
La géographie cesse de dériver d’un plan à l’autre.
styleStyle
Une tonalité cinématographique rendue de façon cohérente, sans contamination entre les rendus d’un projet à plusieurs styles.
Un seul étalonnage sur tout le lot.
La vitrine Wan 3.0 d’Alibaba fait passer deux images de référence à travers trente secondes d’action rapide et tient la fourrure, les vêtements, les fourreaux et le placement d’un bout à l’autre. C’est le plafond ; votre résultat dépend surtout de la qualité des références.
Le vrai travail n’est presque jamais une seule longue prise — ce sont trois ou quatre clips qui doivent avoir l’air de la même production, et la méthode pour ça est plus terne qu’il n’y paraît : gardez tout identique sauf le prompt. Les mêmes fichiers au bit près, le même rôle sur chaque fichier, la même phrase de style à la fin, la même résolution et le même format. Ne changez que l’action et la caméra. Reverser une copie légèrement réexportée de la même photo est la cause habituelle d’une séquence qui dérive, parce que le fichier n’est plus identique — Wan 3.0 n’a aucune mémoire entre deux requêtes, si bien que la cohérence dépend entièrement de ce que vous lui remettez.
Donnez un seul rôle à chaque référence Wan 3.0
C’est la partie qui décide si le résultat a l’air juste, et c’est là que la plupart des tentatives Wan 3.0 échouent. Le modèle ne devine pas pourquoi vous avez téléversé un fichier — vous le lui dites, dans le prompt, par son numéro.
Verrouiller un visage et une garde-robeCe que Wan 3.0 fait de mieux. Une seule personne par image, de face et bien éclairée, l’emporte à chaque fois sur l’artistique — une photo d’identité bat un portrait d’ambiance.
Image 1 est la femme au manteau de laine grise ; gardez son visage, ses cheveux et son manteau à l’identique.
Verrouiller un produit ou un accessoireL’apparence sous plusieurs angles, les logos, les pièces et la matière tiennent tous. Deux angles du même objet valent mieux qu’une seule photo héros.
Image 2 et Image 3 sont le même flacon ; gardez l’étiquette et le bouchon.
Donner un mouvement et un rythmeUn clip de référence n’est pas là pour être copié — il est là pour prêter son rythme : combien de temps un temps fort tient, comment une transition se déplace.
Video 1 ne prête que la cadence de marche, pas le personnage.
Donner une voix, ou poser le décorUne référence audio fixe le timbre, et associée à une référence de visage, la synchronisation labiale la suit. Une image de lieu fixe le placement et le point de vue de la caméra pour que la géographie cesse de dériver.
Audio 1 ne prête que le timbre. Image 4 pose la pièce et la hauteur de caméra.
Écrivez Image 1, pas image1
Image 1 · Video 1 · Audio 1Wan 3.0@image1Seedance
Wan 3.0 attend la forme anglaise, avec une majuscule et une espace. @image1 est la syntaxe de Seedance et plusieurs guides la reprennent ici, où elle n’est pas lue. La numérotation court séparément à l’intérieur de chaque type de média et suit l’ordre de téléversement — réordonnez vos fichiers et vous avez fait une autre requête.
Vingt fichiers, c’est le chiffre d’affiche ; celui que vous devriez réellement utiliser est bien plus petit. Un sujet par image, un rôle par fichier — dès qu’un fichier porte deux rôles contradictoires, ou qu’une image contient deux personnes, le modèle doit deviner, et c’est justement ce que vos références étaient censées éviter. Les bonnes scènes se font avec trois ou quatre. Vous préférez ne pas écrire le reste du prompt ? Le générateur de prompts l’écrit dans l’ordre d’Alibaba.
Quand la cohérence de Wan 3.0 casse, et quoi faire
Le mode référence est la seule voie Wan 3.0 où vos entrées sont facturées elles aussi : un lancement qui revient raté coûte donc double. Voici les cinq façons dont ça tourne mal, dans l’ordre où vous risquez de les rencontrer — et le panneau au-dessus du bouton Générer lit votre montage pour celles qu’il peut voir venir.
Le personnage ne ressemble pas à la référence
Presque toujours parce que l’image contient plus d’une personne, ou parce qu’on a aussi demandé à cette même image de définir le lieu ou le style.
Un sujet par image, un rôle par fichier.
Deux personnages se brouillent là où ils se touchent
Des positions qui se chevauchent plus une action simultanée, c’est le cas le plus difficile. Validez d’abord sur un plan bien séparé, puis ajoutez le contact.
Deux personnages bien séparés sont fiables ; une foule qui se touche, non.
Le mouvement ignore le clip de référence
On a aussi demandé à ce fichier de définir un personnage : il porte donc deux rôles et le modèle doit en choisir un.
Séparez-le en deux fichiers, un rôle chacun.
La note est plus élevée que prévu
Les secondes des clips de référence sont facturées à votre tarif de sortie, et elles comptent dans le même plafond de trente secondes. Les images, l’audio, les documents et les liens sont sans frais.
6 s de référence + 20 s de sortie = 26 secondes facturées.
La requête est refusée avant de générer
Une première image a été envoyée à côté des références. Les deux familles s’excluent, et le refus porte sur la requête entière, pas sur une seule entrée.
Ordre : Image 1 · Image 2 · Video 1 — aucune image d’ouverture.
Commencez simple pour valider la qualité des références, puis ajoutez de la complexité. Une scène qui échoue avec cinq personnages fonctionne souvent avec deux, et deux clips propres montés ensemble valent mieux qu’un seul embrouillé.
Ce que coûte un clip Wan 3.0 en mode référence
Le même tarif à la seconde que tous les autres modes — les références elles-mêmes ne portent aucun supplément. La seule exception est le clip de référence : ses secondes sont facturées au même tarif que votre sortie. Les images, l’audio, les documents et les liens n’ajoutent rien. Comme partout ailleurs, un lancement raté est remboursé automatiquement : la seule chose qu’une mauvaise génération vous coûte, c’est l’attente.
Comment c’est facturé
- Facturé à la
- seconde produite
- Images · audio · fichier · lien de référence
- free
- Clip de référence
- facturée à votre tarif de sortie
- Génération ratée
- refunded
- Images · audio · fichier · lien de référence
- aucun supplément
Le clip de référence est la troisième variable que cette page a et que les autres outils n’ont pas : un clip de référence de 15 secondes sur une sortie de 15 secondes, cela fait trente secondes facturées, pas quinze. Faites vos brouillons en 480P, puis lancez une seule fois celui que vous gardez. Tous les tarifs
Les mêmes crédits mensuels dans les deux cas
Utiliser l’image d’une personne réelle
Wan 3.0 en mode image de référence tient un visage sur toute une prise. C’est la fonctionnalité, et c’est aussi précisément ce qui rend le détournement facile : la règle ici est donc courte — ne téléversez l’image de quelqu’un qu’avec son accord.
- VisagesUne vidéo d’une personne réelle demande son accord — ni personnalités publiques, ni photo d’un inconnu.
- VoixUne référence de timbre clone la façon dont une personne précise sonne. Utilisez la vôtre, une voix sous licence, ou une voix de synthèse.
- PersonnagesUn personnage protégé ne devient pas le vôtre parce qu’un modèle l’a régénéré.
- MineursNe téléversez jamais de références représentant des mineurs.
- ModérationLes médias soumis sont filtrés automatiquement, les signalements arrivent dans une boîte surveillée, et les retraits sont traités rapidement plutôt qu’un jour. Faux positifs et faux négatifs arrivent.
Questions sur Wan 3.0 en mode image de référence
Ce que le mode référence maintient sur une prise, et ce que les secondes de référence ajoutent à la note
Faut-il créer un compte pour essayer le mode image de référence ?
Combien d’images de référence Wan 3.0 accepte-t-il ?
Puis-je utiliser une image de référence et une première image ensemble ?
Pourquoi mon personnage ne ressemble-t-il pas à la référence ?
Le clip de référence rend-il un clip Wan 3.0 plus cher ?
Wan 3.0 peut-il garder une voix cohérente en plus d’un visage ?
Combien de personnages peuvent partager un même plan ?
Les références se transmettent-elles d’une génération à l’autre ?
Quels formats Wan 3.0 accepte-t-il pour les références ?
Puis-je utiliser les vidéos commercialement ?
Distribuez votre première scène Wan 3.0
Téléversez un visage, donnez-lui un rôle, et décrivez le plan. Wan 3.0 en mode image de référence tourne sur les crédits, à partir du 480P — votre matière ne porte aucun supplément et un lancement raté est remboursé automatiquement.
Écrit et maintenu par l’équipe éditoriale de wan-3.runPublié le Mis à jour le Outil version 2026.09.4
