Synchronisation labiale IA Wan 3.0

Déposez un visage, citez la réplique, et la bouche suit les mots. La synchronisation labiale de Wan 3.0 génère la voix dans la même passe que l’image : aucun fichier audio à enregistrer avant, aucune passe de doublage après. De deux à trente secondes, le son dans le MP4, et votre premier clip est offert.

Celui qui parle

Créer une image

JPG · PNG · BMP · WEBP · ≤20 Mo · 240–8000 px · format ≤8:1

0 / 20000

La personne qui parle garde le même visage, les mêmes cheveux, les mêmes vêtements et les mêmes couleurs du début à la fin ; seuls la caméra et le mouvement décrit changent.

Model
Aspect ratio
Duration
Resolution
Créer un compte gratuit · 1 clip sur Wan 3.0

Le clip offert, c’est le même Wan 3.0 avec son son, plafonné à 480P · 3s, et il passe par une file partagée. Un forfait relève le plafond à 1080P et trente secondes — le palier gratuit est une résolution, pas un autre modèle.

1 clip offert sur le vrai modèle · un e-mail, pas de carte · activer le son coûte le même prix que le laisser coupé

Les démos de dialogue Wan 3.0 publiées par Alibaba · Essayer charge le prompt

Une femme à un plan de travail tient un blender portatif rose et parle droit à la caméraPARLÉ FACE CAMÉRA · 9:16 · 720P

Un face caméra de six répliques

Ce qui revient

Ce que fait Wan 3.0 quand le prompt contient une réplique

Chaque clip ici est une démo publiée par Alibaba pour Wan 3.0, et chacune est arrivée avec le prompt qui l’a produite. Appuyez sur Écouter pour la voix, ou sur Utiliser le prompt pour charger l’ensemble dans la zone en haut de cette page — publié en entier, dans la langue où il a été écrit.

  • 1 passeimage, parole et mouvement des lèvres en une seule génération
  • $0de supplément pour la piste audio
  • wan3.0-videole modèle derrière chaque clip de ce bandeau
  • Une femme à un plan de travail tient un blender portatif rose et parle droit à la caméraRéférence
    Six répliques face caméra, le produit tenu par une image de référence
  • Une chanteuse au centre d’une scène sur un toit la nuit, un DJ derrière elle et la ligne d’horizon au loinRéférence
    Une chanteuse qui change de langue, la synchronisation tenant sur les huit
  • Un homme en long manteau gris et lunettes de protection dans un dojo de bois baigné de soleilRéférence
    Deux locuteurs, en japonais, une réplique chacun et aucun chevauchement
  • Un chat roux et un golden retriever au casque devant des micros de podcast sous une enseigne néon ModelTalkPremière image
    Une image fixe de deux animaux devient dix tours de dialogue

Ce qui fait qu’une réplique tombe juste

  • Les mots

    Citez la réplique exacte. Une paraphrase donne une réplique inventée par le modèle.

  • Locuteur

    Fixez qui parle — âge, cheveux, vêtements — sinon c’est la mauvaise bouche qui bouge.

  • Caméra

    Gardez-la sur le visage pendant toute la réplique.

  • Texte

    Terminez par pas de sous-titres, sinon la réplique peut arriver écrite sur l’image.

À partir d’un prompt

Générer une vidéo en synchronisation labiale à partir de phrases simples

Aucun format de scénario, aucune ligne de temps, aucun fichier de voix. Décrivez le plan en phrases ordinaires, citez les mots que dit le personnage en les lui attribuant, et Wan 3.0 dessine l’image, synthétise la voix et y accorde la bouche en une seule requête.

Un prompt, une réplique

Medium A-roll. The woman stands behind the kitchen counter
holding the pink portable blender, speaking naturally to camera.
She says: "I get asked how I make smoothies so quickly."
No subtitles, no text overlays, no UI, no watermark.

  • Le plan, la caméra, et qui parle
  • La réplique citée, et ce qu’il ne faut pas imprimer
2484 / 20,000

Une passe en sortie

Une femme à un plan de travail tient un blender portatif rose et parle droit à la caméra9:16 · 720P · 30 s

wan3.0-video · 16:9 · 720P · 14 s · parole et bouche dans la même passe

Ces quatre lignes sont tirées de la démo de trente secondes d’Alibaba, qui fait 2 484 caractères pour un plafond de 20 000. La place est là pour fixer le locuteur, le produit et les exclusions — pas pour écrire davantage. Téléverser un portrait au lieu d’en décrire un ne change rien à la façon d’écrire la réplique.

Avant de dépenser un crédit

Améliorez votre prompt de synchronisation labiale avec l’IA

Un lancement qui revient raté n’est presque jamais un problème de modèle. C’est un prompt qui a nommé l’image et laissé au hasard l’intention, la caméra et la règle sur les sous-titres.

Le générateur de prompts prend la réplique que vous voulez entendre et renvoie un prompt Wan 3.0 complet autour d’elle — locuteur fixé, un seul mouvement de caméra nommé, les couches sonores hiérarchisées, et la réplique délimitée pour qu’elle soit jouée plutôt que narrée. Il confronte le résultat aux règles que ce modèle applique vraiment : la clause qu’on oublie est ajoutée avant que le crédit ne parte, pas après.

  1. 01

    Tapez la réplique dont vous avez besoin

    Une phrase suffit pour commencer. Qui la dit et où, cela peut tenir en un fragment.

  2. 02

    Récupérez un prompt bâti autour d’elle

    Locuteur, caméra, couches sonores et réplique délimitée, dans l’ordre où Wan 3.0 les lit.

  3. 03

    Envoyez-le ici et ajoutez le visage

    Le prompt arrive dans la zone en haut de cette page, avec la durée et le format déjà réglés.

Ouvrir le générateur de prompts

Vous avez déjà un clip dont l’intention vous plaisait ? Vidéo vers prompt transcrit la réplique et vous la rend entre accolades — la forme que ce modèle joue au lieu de narrer.

De bout en bout

Un enchaînement complet, du script à la vidéo

Quatre portes vers le même point d’accès. Quoi que vous ayez sous la main — un paragraphe de script, une présentation, un portrait ou un clip déjà calculé — il existe un chemin vers une prise parlée, et aucun d’eux ne demande d’ajouter un outil de voix à côté.

  • Un jeune homme et une femme âgée jouent aux échecs à une table sur une place animée

    Script → prompt

    Confiez la réplique et récupérez une description de plan complète bâtie autour d’elle, le locuteur fixé et la réplique déjà attribuée.

    Offert · sans crédits
  • Un poids lourd sur une autoroute dégagée se dépliant en machine marchante

    Présentation ou page → script

    Un PDF ou une URL publique devient l’histoire à partir de laquelle le plan est bâti, plutôt que des diapositives avec un avatar qui les lit.

    50 pages · 100 Mo
  • Deux hommes en costume dans des sanitaires de bureau carrelés, l’un d’eux en pleine réplique

    Portrait + réplique → prise parlée

    Le visage entre comme image un, la réplique entre citée et attribuée, et la bouche la suit.

    2–30 s · jusqu’au 1080P
  • La même femme rousse tenue sur un plan large, un intérieur d’ascenseur et un gros plan dans un atrium commercial

    Nouvelle réplique, même prise

    Changez ce que dit un clip existant sans le retourner : le locuteur, le rythme et le cadrage restent en place, et le mouvement des lèvres est régénéré.

    Des images que vous avez déjà

Tout ce qui précède atterrit au même endroit — mes créations conserve le MP4, le prompt et l’identifiant de tâche de chaque lancement : une prise qui vous a plu se rouvre au lieu de se reconstituer.

Toute la marche à suivre

Comment faire parler une photo avec Wan 3.0

L’étape que les gens ratent est la troisième : décrire l’image que le modèle voit déjà, au lieu d’écrire les mots qu’il ne peut pas deviner.

  1. Déposez le visage

    La vérification est immédiate, dans votre navigateur. Un bon fichier affiche une ligne verte ; un mauvais nomme la correction avant que vous ne dépensiez quoi que ce soit.

    Vérification offerte
  2. Citez la réplique, et dites qui la dit

    Les mots exacts entre guillemets, attribués à la personne à l’écran. Une paraphrase — « elle dit quelque chose de rassurant » — vous donne une réplique inventée par le modèle.

    Les mots exacts, uniquement
  3. Terminez par « pas de sous-titres »

    Il n’y a pas de champ de prompt négatif : l’instruction de ne pas imprimer la réplique est donc une phrase comme les autres. C’est une seule proposition, et elle sauve un lancement entier.

    Une proposition
  4. Réglez la durée et la résolution, puis générez

    Achetez d’abord les secondes dont la réplique a besoin. Un seul MP4 revient, avec la parole, l’ambiance et le mouvement des lèvres déjà dedans.

    Jusqu’au 1080P

Environ quatre-vingt-dix secondes pour un clip court, et vous pouvez fermer l’onglet pendant que ça tourne. La photographie téléversée n’est jamais modifiée — la sortie est un nouveau fichier.

Ce que veut dire synchronisation labiale ici

Votre photographie est l’image un. La voix s’écrit, elle ne se téléverse pas.

La plupart des outils de cette catégorie prennent une photo et un fichier audio, puis font bouger la bouche pour correspondre. Celui-ci prend une photo et une phrase.

Un portrait utilisé comme image d’ouverture d’un clip de synchronisation labiale Wan 3.0

Image 001 · votre visage

Parlé, et synchronisé, à partir d’ici

La synchronisation labiale de Wan 3.0 place votre photographie comme première image au sens littéral et génère 2 à 30 secondes vers l’avant, à 30 fps en 480P, 720P ou 1080P. Les mots que vous avez cités reviennent en parole dans la piste audio de ce clip, avec la bouche qui les suit, parce que l’image et le son sont calculés dans la même passe plutôt que recousus en deux.

Votre photo est l’image un
001

Votre photo est l’image un

Fichiers audio que vous devez fournir
0

Fichiers audio que vous devez fournir

N’importe quelle seconde entière
2–30 s

N’importe quelle seconde entière

Un MP4 en retour, le son déjà dedans
1

Un MP4 en retour, le son déjà dedans

  • Aucune étape de synthèse vocale avant le calcul
  • Aucune passe de doublage après
  • Aucun second modèle à licencier pour la bouche

La réplique

Ce qui décide qu’une réplique est dite ou imprimée en travers de l’image

Deux phrases décident si une réplique est entendue ou lue. L’une met les mots exacts dans la bouche du locuteur ; l’autre les garde hors de l’image. Oubliez l’une des deux et l’échec arrive sous forme de vidéo finie et facturée.

L’anatomie d’une réplique synchronisée

Parole et image · une seule passe

…speaking naturally to camera. She says:"It blends everything smooth."

Realistic kitchen ambience, blending motor, casual room tone.No subtitles, no text overlays.

Un chat roux et un golden retriever au casque devant des micros de podcast sous une enseigne néon ModelTalkDix tours · 720P · 30 s
Deux locuteurs, dix tours, et seul celui qui parle ouvre la bouche — appuyez pour le son

Ce qu’il faut à la bouche pour tomber juste

3

  • Les mots exacts, cités plutôt que résumés
  • Un locuteur décrit d’assez près pour être fixé
  • La caméra sur son visage pendant qu’il parle

La règle qu’on oublie

Il n’y a pas de champ de prompt négatif : « ne pas imprimer ceci » est donc une phrase du prompt comme une autre. Omettez-la et le modèle est en droit de traiter votre dialogue comme quelque chose à dessiner à l’écran en plus de le dire — c’est pourquoi la démo de trente secondes d’Alibaba, publiée plus haut, se termine exactement sur cette instruction.

  • no subtitles, no text overlaysJuste
  • Negative prompt: subtitlesFaux

Tout ce qui a la forme d’un prompt négatif est lu comme des mots de plus à dessiner, et la requête aboutit quand même — l’échec arrive donc sous forme de clip fini avec la mention « Negative prompt » quelque part dans l’image.

Les accolades marchent aussi — {like this} est ce qu’émettent les outils de prompt de ce site. Ce que le modèle cherche vraiment, c’est une réplique délimitée avec un locuteur visible attaché, et les prompts publiés par Alibaba utilisent les guillemets pour cela. Texte vers vidéo couvre les quatre couches sonores et l’ordre dans lequel les nommer.

Avant de dépenser

Vérifiez le portrait avant de dépenser un crédit

Un visage que Wan 3.0 ne saura pas lire est la façon la plus agaçante de perdre une génération, parce que vous l’apprenez après la file d’attente et non avant. Déposez la photographie ici et elle est confrontée aux vraies limites — format, poids, dimensions, proportions et transparence — avec la correction nommée pour la ligne qui échoue. Rien n’est téléversé : la vérification tourne dans votre navigateur.

JPG · JPEG · PNG · BMP · WEBP · ≤20.0 MB · 2408,000px · ratio ≤8:1

Un seul visage, cadré pour que la bouche ne soit pas le plus petit élément de l’image, donne à la synchronisation le plus de matière. Le vérificateur ne touche jamais au modèle : un portrait qui n’avait aucune chance d’être lu ne coûte rien à identifier.

Ce qui entre

Les limites de la synchronisation labiale — le portrait, le clip et la voix

Cinq de ces lignes gouvernent la photographie, deux gouvernent ce qui sort, et la dernière est celle qui produit un refus que personne n’attend. La zone de téléversement en haut de cette page contrôle les lignes d’image avant que vous ne dépensiez quoi que ce soit.

Une première image verrouillée et un enregistrement de voix ne peuvent pas voyager ensemble. Les images d’ouverture sont une famille d’entrées et les références en sont une autre ; une requête qui porte les deux est refusée tout net plutôt que rétrogradée, si bien que le choix se fait avant le téléversement.

Format du portrait
JPEG · JPG · PNG · BMP · WEBPLe HEIC est refusé — le conteneur par défaut de l’iPhone n’est pas sur la liste
Officiel
Poids du portrait
≤ 20 Mo
Officiel
Dimensions
240 – 8 000 px par côté
Officiel
Format d’image
8:1 – 1:8Une plage, pas un plafond — une colonne en 1:9 est refusée comme une bannière en 9:1
Officiel
Transparence
non acceptéeUne couche alpha PNG est refusée plutôt qu’aplatie
Officiel
Durée du clip
2 – 30 s à 30 fpsN’importe quel nombre entier de secondes, en 480P, 720P ou 1080P
Officiel
Référence vocale
5 pistes · ≤ 15 s au totalWAV ou MP3, jusqu’à 15 Mo chacune, 1–15 s par piste
Officiel
Images d’ouverture et références
mutuellement exclusives
Officiel

La réplique elle-même n’a ni champ ni limite à part : elle vit dans le prompt avec tout le reste, et le prompt tient 20 000 caractères. Ce qui contraint une réplique parlée, c’est l’horloge, pas le nombre de caractères — environ deux à trois secondes d’écran par phrase courte, si bien qu’une réplique de quinze mots dans un clip de quatre secondes est soit précipitée, soit coupée. Achetez les secondes dont la réplique a besoin avant d’acheter la résolution.

Tarifs · le 1080P sur tous les forfaits payants · son natif

Ce que coûte un clip en synchronisation labiale Wan 3.0

La durée et la résolution fixent le prix. La parole, non : l’interrupteur audio change ce qui revient, pas ce que ça coûte, et une référence vocale n’est pas facturée du tout. Un lancement raté est remboursé automatiquement, et le vérificateur ci-dessus tient l’essentiel des échecs évitables à l’écart du modèle dès le départ.

Comment c’est facturé

Facturé à la
seconde produite
Parole, référence vocale
sans frais
Votre premier clip
offert · 480P

Faites tourner la réplique en 480P jusqu’à ce que l’intention tombe juste, puis dépensez un lancement en 720P ou 1080P — le portrait n’a pas besoin d’être revérifié entre les deux. Tous les tarifs.

Les mêmes crédits mensuels dans les deux cas

  • Premier clip offertSans carte

    Une génération sur le vrai wan3.0-video. Voyez ce que Wan 3.0 fait de votre propre plan — 480P, trois secondes, le son dans la même passe.

    $0une fois

    Pas de carte, à aucun moment

    Générer le clip offert

    Un e-mail, pas de carte

    1 clip, une fois

    480P · jusqu’à 3 s · avec le son
    Un e-mail, pas de carte

    Le même `wan3.0-video` qu’Alibaba fait tourner pour les forfaits payants — le 480P est une résolution, pas un modèle au rabais

    • Le vrai wan3.0-video, pas le 2.7
    • Le son généré avec l’image
    • Identifiants du modèle et de la tâche sur le reçu
    • Un lancement raté ne vous coûte jamais rien
    • Le 720P et le 1080PPayant
    • Les clips de plus de 3 secondesPayant
    • Les modes référence, document et retouchePayant
    • Plus d’un clip, un jourPayant

    Une question tranchée : ce que Wan 3.0 fait de votre idée. Le 1080P, les trente secondes et tous les modes d’entrée démarrent à $12.90.

    En un coup d’œil

    Clips par mois
    1, une fois
    Prises par lancement
    1
    Clip le plus long
    3s
    Résolution maximale
    480P
  • StarterJusqu’à 20 % d’économie

    Une annonce par semaine. De quoi savoir si le générateur de vidéo IA Wan 3.0 convient à votre façon de travailler, sans décision sur le volume.

    $12.90/ mois$15.90

    $154.80 facturés à l’année

    Résiliable à tout moment

    640 crédits / mois · ≈ 16 clips

    à 5 s en 480P · 8 en 720P · 4 en 1080P

    Les crédits du forfait expirent à la fin du mois

    • 640 crédits par mois — environ 16 clips finis
    • 2 prises d’un même prompt par lancement
    • Toutes les résolutions — 480P, 720P et 1080P
    • Toutes les durées — de 2 à 30 secondes en une passe
    • Toutes les entrées — texte, photo, référence, document, page web
    • Le son écrit dans la même passe, aucun filigrane incrusté
    • Utilisation commerciale incluse — publiez, vendez, facturez
    • Wan 3.0 Prime, le palier rapide, quand vous voulez
    • Un lancement raté ne coûte jamais de crédits
    • Remboursement sous 7 jours tant que les crédits sont intacts
    • Résiliation en deux clics — le prix d’entrée reste bloqué

    Tout ce qui suit les deux premières lignes est compris dans ce forfait à $12.90. Les forfaits plus grands achètent des secondes et des prises — jamais un meilleur modèle.

    En un coup d’œil

    Clips par mois
    ≈ 12 à 5 s en 480P
    Prises par lancement
    2
    Crédits par dollar
    Référence
    Délai de rétractation
    7 jours
  • C’est là que la plupart atterrissent
    Pro

    Un clip fini par jour ouvré, avec trois variantes chacun. La boucle brouillon en 480P, rendu final en 1080P, taillée pour une semaine de travail.

    $39.90/ mois$49.90

    $478.80 facturés à l’année

    Résiliable à tout moment

    2 240 crédits / mois · ≈ 56 clips

    à 5 s en 480P · 28 en 720P · 14 en 1080P

    Les crédits du forfait expirent à la fin du mois

    • 2 240 crédits par mois — 3,5× Starter
    • ≈ 56 clips finis par mois, ou 14 en 1080P plein
    • 4 prises d’un même prompt par lancement — choisissez au lieu de relancer2× prises
    • +21 % de crédits par dollar par rapport à StarterMeilleur taux
    • De quoi faire les brouillons en 480P et le rendu final en 1080P dans la même semaine
    • Toutes les résolutions — 480P, 720P et 1080P
    • Toutes les durées — de 2 à 30 secondes en une passe
    • Toutes les entrées — texte, photo, référence, document, page web
    • Le son écrit dans la même passe, aucun filigrane incrusté
    • Utilisation commerciale incluse — publiez, vendez, facturez
    • Wan 3.0 Prime, le palier rapide, quand vous voulez
    • Un lancement raté ne coûte jamais de crédits
    • Remboursement sous 7 jours tant que les crédits sont intacts
    • Résiliation en deux clics — le prix d’entrée reste bloqué

    Le saut depuis Starter, c’est la quantité, les prises et le taux. Le modèle, les résolutions et les trente secondes étaient déjà à vous.

    En un coup d’œil

    Clips par mois
    ≈ 44 à 5 s en 480P
    Prises par lancement
    4
    Crédits par dollar
    +21 % vs Starter
    Délai de rétractation
    7 jours
  • StudioMeilleur taux

    Du volume client, et le forfait où vous cessez de rationner le 1080P. Trente et un clips finis en pleine résolution par mois, au prix au crédit le plus bas que nous vendions.

    $99.90/ mois$119.90

    $1,198.80 facturés à l’année

    Résiliable à tout moment

    6 240 crédits / mois · ≈ 156 clips

    à 5 s en 480P · 78 en 720P · 39 en 1080P

    Les crédits du forfait expirent à la fin du mois

    • 6 240 crédits par mois — 9,75× Starter, 2,8× Pro13×
    • ≈ 156 clips finis par mois, ou 39 en 1080P plein
    • +28 % de crédits par dollar — le meilleur taux que nous vendionsMeilleur taux
    • Assez de 1080P pour cesser de passer par un brouillon en 480P
    • 4 prises d’un même prompt par lancement
    • Taillé pour un portefeuille de clients plutôt qu’une seule chaîne
    • Rechargez n’importe quel mois sans changer de forfait
    • Toutes les résolutions — 480P, 720P et 1080P
    • Toutes les durées — de 2 à 30 secondes en une passe
    • Toutes les entrées — texte, photo, référence, document, page web
    • Le son écrit dans la même passe, aucun filigrane incrusté
    • Utilisation commerciale incluse — publiez, vendez, facturez
    • Wan 3.0 Prime, le palier rapide, quand vous voulez
    • Un lancement raté ne coûte jamais de crédits
    • Remboursement sous 7 jours tant que les crédits sont intacts
    • Résiliation en deux clics — le prix d’entrée reste bloqué

    Le forfait pour un portefeuille de clients plutôt qu’une seule chaîne : quatre prises de chaque prompt, du 1080P sans rationnement, et de quoi refaire une scène sans surveiller le solde.

    En un coup d’œil

    Clips par mois
    ≈ 124 à 5 s en 480P
    En 1080P plein
    ≈ 31 par mois
    Crédits par dollar
    +28 % vs Starter
    Délai de rétractation
    7 jours

Questions

Synchronisation labiale Wan 3.0 — les questions avec lesquelles on arrive vraiment

Celles qui méritent une réponse avant de téléverser un visage, avec les chiffres pris dans le tableau de paramètres d’Alibaba plutôt que sur une fiche produit.

Faut-il un fichier audio pour obtenir la synchronisation labiale ?

Non — vous pouvez arrêter d’en chercher un. Citez les mots dans le prompt en les attribuant à la personne à l’écran — She says: "Two minutes to set up." — et Wan 3.0 génère lui-même la parole, dans la même passe que l’image, avec la bouche qui la suit. Une photographie et une phrase, c’est toute l’entrée. Un enregistrement de voix est l’autre voie, pour quand le timbre doit être un timbre précis.

Comment écrire la réplique pour qu’elle soit dite plutôt que décrite ?

Citez-la et rattachez-la à quelqu’un. La formule de prompt d’Alibaba place le contenu parlé à côté de l’émotion, du ton et de l’accent qu’il doit porter, et chaque démo de cette page la suit — She says: "…", puis l’intention. Des mots seulement résumés se font narrer ou inventer. Les outils de prompt de ce site entourent les répliques d’accolades, {like this}, ce qui fait le même travail de marquer où la réplique commence et s’arrête.

Ma réplique est sortie imprimée à l’écran au lieu d’être dite. Pourquoi ?

Parce que rien dans le prompt ne disait de ne pas l’imprimer. Ce modèle n’a pas de champ de prompt négatif : les exclusions sont des phrases ordinaires — terminez par « pas de sous-titres, pas d’incrustation de texte » et la réplique sort en audio. Écrire Negative prompt: subtitles fait l’inverse : ces mots deviennent quelque chose à dessiner.

Puis-je téléverser ma photo et mon enregistrement de voix ensemble ?

Pas dans une même requête. Une photographie fixée comme première image appartient à la famille des images d’ouverture et une piste audio à la famille des références, et les deux familles s’excluent — la requête est refusée plutôt que rétrogradée. Choisissez : l’image d’ouverture exacte avec une voix générée, ou votre voix enregistrée avec la photo attachée comme référence.

Quelle longueur peut faire la réplique ?

Assez longue pour les secondes que vous avez achetées. Le champ de prompt tient 20 000 caractères et le clip tient de 2 à 30 secondes à 30 fps : la contrainte, c’est l’horloge. La démo de trente secondes d’Alibaba ci-dessus fait tenir six répliques, soit environ une phrase courte toutes les cinq secondes une fois les plans de coupe comptés. Une réplique qui déborde est précipitée ou coupée, et aucune longueur de prompt n’y change rien — achetez plutôt des secondes.

Dans quelles langues la synchronisation labiale fonctionne-t-elle ?

Dans plus de langues qu’on ne le croirait, et la preuve est sur cette page : le clip sur les toits ci-dessus est la démo d’Alibaba où une chanteuse passe par huit langues avec la synchronisation qui tient, et le clip du dojo joue son dialogue en japonais. Ce qui n’existe pas, c’est une liste publiée des langues parlées prises en charge, ni le moindre paramètre de verrouillage phonétique : traitez donc tout chiffre précis cité ailleurs comme une supposition. Lancez trois secondes en 480P dans la langue qu’il vous faut — ça coûte une fraction d’un rendu fini et ça répond à la question pour votre cas.

Deux personnes peuvent-elles parler dans le même clip ?

Oui, et le clip du podcast ci-dessus en met deux à échanger dix tours. Donnez à chaque locuteur une étiquette unique et assez de description pour être distingué, ancrez chaque réplique à quelque chose que ce locuteur fait visiblement, puis écrivez les répliques dans l’ordre où elles sont dites. Alibaba est explicite : les pronoms fusionnent les locuteurs — « il dit… puis il dit » est la façon dont deux personnages finissent avec une seule voix.

La parole coûte-t-elle un supplément ?

Non. La facturation se fait à la seconde produite et à la résolution uniquement : un clip avec dialogue coûte exactement ce que coûte le même clip en silence. Les images et l’audio de référence ne sont pas facturés non plus. La seule entrée qui alourdit la note est un clip de référence — ces secondes sont facturées au tarif de sortie, en plus de celles que vous avez demandées.

Le reste de l’image reste-t-il immobile pendant qu’on parle ?

Seulement si vous le dites. Votre photographie est l’image un, pas une plaque verrouillée — tout ce qui suit est généré, si bien que la pièce, la lumière et le cadrage dérivent à moins que le prompt ne les fixe. Les deux démos d’Alibaba ci-dessus consacrent chacune un paragraphe à exactement cela, en nommant ce qui doit rester identique ; le verrou d’apparence à côté de la zone de prompt écrit la même clause pour vous.

Puis-je publier un clip parlé à des fins commerciales ?

Oui. L’utilisation commerciale est incluse dans tous les forfaits payants, aucun filigrane incrusté et aucune licence séparée à acheter, selon la politique d’usage d’Alibaba et nos conditions. La limite n’est pas la licence, c’est le visage : la personne sur la photographie et la voix sur l’enregistrement doivent toutes deux avoir donné leur accord.

Un visage, une phrase

Téléversez le portrait, citez la réplique que vous voulez entendre, et écoutez ce qui revient. Un clip Wan 3.0 offert en 480P, jusqu’à trois secondes — un e-mail, pas de carte. Si l’intention n’est pas celle que vous imaginiez, ça ne vous aura rien coûté.

Écrit et maintenu par l’équipe éditoriale de wan-3.runPublié le Mis à jour le Outil version 2026.09.4