Wan 3.0 Sincronização Labial
Larga lá uma cara, cita a fala, e a boca acompanha as palavras. A sincronização labial do Wan 3.0 gera a voz na mesma passagem que a imagem, por isso não há ficheiro de áudio para gravar antes nem passagem de dobragem a seguir. Dois a trinta segundos, som dentro do MP4, e o teu primeiro clip é grátis.
As demonstrações de diálogo do Wan 3.0 da própria Alibaba · Experimentar carrega o prompt
FALADO PARA A CÂMARA · 9:16 · 720PUma peça para a câmara, com seis falas
O que o Wan 3.0 faz quando o prompt traz uma fala lá dentro
Todos os clips aqui são demonstrações que a Alibaba publicou para o Wan 3.0, e cada um chegou com o prompt que o produziu. Carrega em Ouvir para a voz, ou em Usar o prompt para carregar tudo na caixa no topo desta página — impresso na íntegra, na língua em que foi escrito.
- 1 passagemimagem, fala e movimento da boca numa só geração
- $0a mais pela faixa de áudio
- wan3.0-videoo modelo por trás de cada clip desta faixa
ReferênciaSeis falas para a câmara, com o produto preso a uma imagem de referência
ReferênciaUma cantora a mudar de língua, com a sincronização a aguentar nas oito
ReferênciaDois oradores, em japonês, uma fala cada um e sem se atropelarem
Primeiro frameUma imagem fixa de dois animais passa a dez rondas de diálogo
- As palavras
Cita a fala exata. Uma paráfrase dá-te uma fala inventada pelo modelo.
- Orador
Fixa quem está a falar — idade, cabelo, roupa — ou mexe-se a boca errada.
- Câmara
Mantém-na na cara durante toda a fala.
- Texto
Fecha com sem legendas, ou a fala pode chegar impressa no quadro.
Gera vídeo com sincronização labial a partir de prompts de texto simples
Sem formato de guião, sem linha de tempo, sem ficheiro de voz. Descreve o plano em frases normais, cita as palavras que a personagem diz e atribui-as a quem está em câmara, e o Wan 3.0 desenha a imagem, sintetiza a voz e move a boca com ela num único pedido.
Plano médio principal. A mulher está atrás do balcão da cozinha
com a liquidificadora portátil cor-de-rosa na mão, a falar com naturalidade para a câmara.
Ela diz: «Perguntam-me muito como faço os batidos tão depressa.»
Sem legendas, sem texto sobreposto, sem interface, sem marca de água.
- Plano, câmara, e quem está a falar
- A fala citada, e o que não imprimir
9:16 · 720P · 30 swan3.0-video · 16:9 · 720P · 14 s · fala e boca na mesma passagem
Aquelas quatro linhas saíram da demonstração de trinta segundos da própria Alibaba, que chega aos 2 484 caracteres contra um teto de 20 000. O espaço que sobra é para fixar o orador, o produto e as exclusões — não para escrever mais. Carregar um retrato em vez de descrever um não muda nada na forma como a fala em si se escreve.
Melhora o prompt do teu vídeo com sincronização labial
com IA
Uma execução que volta errada quase nunca é um problema do modelo. É um prompt que nomeou a imagem e deixou ao acaso a interpretação, a câmara e a regra das legendas.
O gerador de prompts pega na fala que queres ouvir e devolve um prompt completo do Wan 3.0 à volta dela — o orador fixado, um movimento de câmara nomeado, as camadas de áudio por ordem, e a fala delimitada para ser interpretada e não narrada. Confere o resultado contra as regras que este modelo realmente impõe, por isso a cláusula de que as pessoas se esquecem é acrescentada antes de o crédito ser gasto, e não depois.
01
Escreve a fala que precisas de ouvir
Uma frase chega para começar. Quem a diz e onde pode ser só um fragmento.
02
Recebe um prompt construído à volta dela
Orador, câmara, camadas de som e a fala delimitada, pela ordem em que o Wan 3.0 as lê.
03
Envia-o para aqui e acrescenta a cara
O prompt chega à caixa no topo desta página com a duração e a proporção já definidas.
Estás a escrever a fala para um anúncio pago e não para uma peça para a câmara? O gerador de anúncios UGC tem a contagem de palavras que quinze segundos aguentam mesmo, e as regras de divulgação que decidem se ele corre.
Já tens um clip cuja interpretação te agradou? O vídeo para prompt transcreve a fala e devolve-a entre chavetas — a forma que este modelo interpreta em vez de narrar.
Um fluxo de trabalho completo com IA, do guião ao vídeo
Quatro portas para o mesmo sítio. Seja o que for que tens na mão — um parágrafo de guião, uma apresentação, um retrato, ou um clip que já renderizaste — há um caminho daí até uma tomada com alguém a falar, e nenhum deles precisa de uma ferramenta de voz aparafusada ao lado.
Tudo o que está acima aterra no mesmo sítio — as minhas criações guarda o MP4, o prompt e o id da tarefa de cada execução, por isso uma tomada de que gostaste pode ser reaberta em vez de reconstruída.
Como sincronizar os lábios de uma foto
com o Wan 3.0
O passo em que as pessoas se enganam é o terceiro: descrever a imagem que o modelo já está a ver, em vez de escrever as palavras que ele não consegue adivinhar.
Larga lá a cara
A verificação corre instantaneamente, no teu navegador. Um ficheiro bom mostra uma linha verde; um mau nomeia a solução antes de gastares o que quer que seja.
Verificado sem custoCita a fala, e diz quem a diz
As palavras exatas entre aspas, atribuídas a quem está em câmara. Uma paráfrase — «ela diz qualquer coisa tranquilizadora» — dá-te uma fala inventada pelo modelo.
Só as palavras exatasFecha com «sem legendas»
Não existe campo de prompt negativo, por isso a instrução para não imprimir a fala é uma frase como as outras. É uma cláusula e poupa uma execução inteira.
Uma cláusulaDefine a duração e a resolução, e gera
Compra primeiro os segundos de que a fala precisa. Volta um MP4 com a fala, o som de sala e o movimento da boca já lá dentro.
Até 1080P
Cerca de noventa segundos para um clip curto, e podes fechar o separador enquanto corre. A fotografia carregada nunca é alterada — a saída é um ficheiro novo.
A tua fotografia é o frame um.
A voz escreve-se, não se carrega.
A maior parte das ferramentas desta categoria pega numa imagem e num ficheiro de áudio e move a boca para acompanhar. Esta pega numa imagem e numa frase.

Frame 001 · a tua cara
Falado, e sincronizado, daqui para a frente
A sincronização labial do Wan 3.0 mete a tua fotografia lá dentro como literalmente o primeiro frame e gera 2 a 30 segundos para a frente a partir dela, a 30 fps em 480P, 720P ou 1080P. As palavras que citaste voltam como fala na faixa de áudio desse clip, com a boca a mexer-se com elas, porque a imagem e o som são renderizados na mesma passagem em vez de serem cosidos em duas.
- A tua foto é o frame um
- 001
- Ficheiros de áudio que tens de fornecer
- 0
- Qualquer segundo inteiro
- 2–30 s
- MP4 de volta, com o som já lá dentro
- 1
A tua foto é o frame um
Ficheiros de áudio que tens de fornecer
Qualquer segundo inteiro
MP4 de volta, com o som já lá dentro
- Sem passo de texto para voz antes da renderização
- Sem passagem de dobragem depois dela
- Sem um segundo modelo para licenciar por causa da boca
O que decide se uma fala é dita
ou impressa no quadro
Duas frases decidem se uma fala se ouve ou se lê. Uma põe as palavras exatas na boca do orador; a outra mantém-nas fora da imagem. Deixa uma delas de fora e a falha chega em forma de vídeo acabado e cobrado.
A anatomia de uma fala sincronizada
Fala e imagem · uma passagem
Dez rondas · 720P · 30 sO que a boca precisa para acertar
3
- As palavras exatas, citadas e não resumidas
- Um orador descrito com detalhe suficiente para ficar fixo
- A câmara na cara dele enquanto fala
A regra que escapa às pessoas
Não existe campo de prompt negativo, por isso «não imprimas isto» é uma frase do prompt como qualquer outra. Deixa-a de fora e o modelo fica livre para tratar o teu diálogo como uma coisa a desenhar no ecrã além de dizer — e é por isso que a demonstração de trinta segundos da própria Alibaba, impressa acima, acaba exatamente nessa instrução.
sem legendas, sem texto sobrepostoCertoPrompt negativo: legendasErrado
Tudo o que tenha a forma de um prompt negativo é lido como mais palavras para renderizar, e o pedido continua a resultar — por isso a falha chega como um clip acabado com o rótulo «Prompt negativo» algures no quadro.
As chavetas também funcionam — {like this} é o que as ferramentas de prompt deste site produzem. O que o modelo procura mesmo é uma fala delimitada com um orador visível agarrado a ela, e os prompts publicados pela própria Alibaba usam aspas para isso. O texto para vídeo cobre as quatro camadas de som e a ordem por que se nomeiam.
Confere o retrato
antes de gastares um crédito
Uma cara que o Wan 3.0 não lê é a maneira mais irritante de perder uma geração, porque só ficas a saber depois da fila e não antes dela. Larga aqui a fotografia e ela é conferida contra os limites reais — formato, tamanho, dimensões, proporção e transparência — com a solução nomeada para a linha que falhar. Não se carrega nada: a verificação corre no teu navegador.
JPG · JPEG · PNG · BMP · WEBP · ≤20.0 MB · 240–8,000px · ratio ≤8:1
Uma cara, enquadrada de forma que a boca não seja a coisa mais pequena da imagem, é o que dá mais matéria à sincronização. O verificador nunca toca no modelo, por isso um retrato que nunca ia ser lido não custa nada a descobrir.
Limites da sincronização labial do Wan 3.0
— o retrato, o clip e a voz
Cinco destas linhas mandam na fotografia, duas mandam no que sai, e a última é a que produz uma recusa que ninguém espera. A caixa de carregamento no topo desta página confere as linhas da imagem antes de gastares o que quer que seja.
Um primeiro frame fixo e uma gravação de voz não podem viajar juntos. Os frames são uma família de entradas e as referências são a outra; um pedido que traga as duas é recusado logo em vez de ser despromovido, por isso a escolha faz-se antes de carregares.
A fala em si não tem campo próprio nem limite próprio: vive no prompt com tudo o resto, e o prompt aguenta 20 000 caracteres. O que restringe uma fala é o relógio, não a contagem de caracteres — cerca de dois a três segundos de ecrã por frase curta, por isso uma fala de quinze palavras num clip de quatro segundos ou sai atropelada ou fica cortada. Compra os segundos de que a fala precisa antes de comprares a resolução.
Quanto custa um clip de sincronização labial do Wan 3.0
A duração e a resolução definem o preço. A fala não: o interruptor do áudio muda o que volta, não o que custa, e uma referência de voz não é cobrada de todo. Uma execução falhada é reembolsada automaticamente, e o verificador acima mantém a maior parte das falhas evitáveis longe do modelo logo à partida.
Como isto é cobrado
- Cobrado por
- segundo de saída
- Fala, referência de voz
- sem custo
- O teu primeiro clip
- grátis · 480P
Esboça a fala em 480P até a interpretação acertar, e depois gasta uma execução em 720P ou 1080P — o retrato não precisa de ser conferido outra vez entre execuções. Preços completos.
Os mesmos créditos mensais nos dois casos
Sincronização labial do Wan 3.0 — as perguntas com que as pessoas chegam mesmo
As que vale a pena responder antes de carregares uma cara, com os números tirados da tabela de parâmetros da própria Alibaba e não de uma lista de funcionalidades.
Preciso de um ficheiro de áudio para ter sincronização labial?
She says: "Two minutes to set up." — e o Wan 3.0 gera ele próprio a fala, na mesma passagem que a imagem, com a boca a mexer-se com ela. Uma fotografia e uma frase são a entrada toda. Uma gravação de voz é a outra via, para quando o timbre tem de ser um timbre concreto.Como escrevo a fala para que seja dita em vez de descrita?
She says: "…", e depois a interpretação. Palavras que só ficam resumidas acabam narradas ou inventadas. As ferramentas de prompt deste site envolvem as falas em chavetas, {like this}, que faz o mesmo trabalho de marcar onde a fala começa e acaba.A minha fala saiu impressa no ecrã em vez de dita. Porquê?
Negative prompt: subtitles faz o contrário: aquelas palavras passam a ser uma coisa para desenhar.Posso carregar a minha foto e a minha gravação de voz ao mesmo tempo?
Que comprimento pode ter a fala?
Em que línguas é que a sincronização labial funciona?
Podem falar duas pessoas no mesmo clip?
A fala custa mais?
O resto da imagem fica quieto enquanto eles falam?
De quem posso usar a cara e a voz?
Posso publicar comercialmente um clip falado?
Uma cara, uma frase
Carrega o retrato, cita a fala que precisas de ouvir, e ouve o que volta. Um clip Wan 3.0 gratuito a 480P, até três segundos — um e-mail, sem cartão. Se a interpretação não for a que imaginaste, não te custou nada.
Escrito e mantido pela equipa editorial de wan-3.runPublicado a Atualizado a Ferramenta versão 2026.09.4




