Wan 3.0 Sincronização Labial

Larga lá uma cara, cita a fala, e a boca acompanha as palavras. A sincronização labial do Wan 3.0 gera a voz na mesma passagem que a imagem, por isso não há ficheiro de áudio para gravar antes nem passagem de dobragem a seguir. Dois a trinta segundos, som dentro do MP4, e o teu primeiro clip é grátis.

O orador

Criar imagem

JPG · PNG · BMP · WEBP · ≤20 MB · 240–8000 px · proporção ≤8:1

0 / 20000

O orador mantém a mesma cara, cabelo, roupa e cores do princípio ao fim; só a câmara e o movimento descrito mudam.

Model
Aspect ratio
Duration
Resolution
Regista-te grátis · 1 clip no Wan 3.0

O clip grátis é o mesmo Wan 3.0 com o seu som, limitado a 480P · 3s, e entra em fila na capacidade partilhada. Um plano sobe o limite para 1080P e trinta segundos — o nível gratuito é uma resolução, não um modelo diferente.

1 clip grátis no modelo verdadeiro · um e-mail, sem cartão · ligar o som custa o mesmo que deixá-lo desligado

As demonstrações de diálogo do Wan 3.0 da própria Alibaba · Experimentar carrega o prompt

Uma mulher a um balcão de cozinha com uma liquidificadora portátil cor-de-rosa na mão, a falar diretamente para a câmaraFALADO PARA A CÂMARA · 9:16 · 720P

Uma peça para a câmara, com seis falas

O que volta

O que o Wan 3.0 faz quando o prompt traz uma fala lá dentro

Todos os clips aqui são demonstrações que a Alibaba publicou para o Wan 3.0, e cada um chegou com o prompt que o produziu. Carrega em Ouvir para a voz, ou em Usar o prompt para carregar tudo na caixa no topo desta página — impresso na íntegra, na língua em que foi escrito.

  • 1 passagemimagem, fala e movimento da boca numa só geração
  • $0a mais pela faixa de áudio
  • wan3.0-videoo modelo por trás de cada clip desta faixa
  • Uma mulher a um balcão de cozinha com uma liquidificadora portátil cor-de-rosa na mão, a falar diretamente para a câmaraReferência
    Seis falas para a câmara, com o produto preso a uma imagem de referência
  • Uma cantora ao centro num palco de terraço à noite, com um DJ atrás dela e a linha do horizonte da cidade ao fundoReferência
    Uma cantora a mudar de língua, com a sincronização a aguentar nas oito
  • Um homem de sobretudo cinzento comprido e óculos de proteção num dojo de madeira iluminado pelo solReferência
    Dois oradores, em japonês, uma fala cada um e sem se atropelarem
  • Um gato ruivo e um golden retriever de auscultadores a microfones de podcast por baixo de um letreiro de néon ModelTalkPrimeiro frame
    Uma imagem fixa de dois animais passa a dez rondas de diálogo

O que faz uma fala acertar

  • As palavras

    Cita a fala exata. Uma paráfrase dá-te uma fala inventada pelo modelo.

  • Orador

    Fixa quem está a falar — idade, cabelo, roupa — ou mexe-se a boca errada.

  • Câmara

    Mantém-na na cara durante toda a fala.

  • Texto

    Fecha com sem legendas, ou a fala pode chegar impressa no quadro.

A partir de um prompt de texto

Gera vídeo com sincronização labial a partir de prompts de texto simples

Sem formato de guião, sem linha de tempo, sem ficheiro de voz. Descreve o plano em frases normais, cita as palavras que a personagem diz e atribui-as a quem está em câmara, e o Wan 3.0 desenha a imagem, sintetiza a voz e move a boca com ela num único pedido.

Um prompt, uma fala

Plano médio principal. A mulher está atrás do balcão da cozinha
com a liquidificadora portátil cor-de-rosa na mão, a falar com naturalidade para a câmara.
Ela diz: «Perguntam-me muito como faço os batidos tão depressa.»
Sem legendas, sem texto sobreposto, sem interface, sem marca de água.

  • Plano, câmara, e quem está a falar
  • A fala citada, e o que não imprimir
2484 / 20,000

Uma passagem à saída

Uma mulher a um balcão de cozinha com uma liquidificadora portátil cor-de-rosa na mão, a falar diretamente para a câmara9:16 · 720P · 30 s

wan3.0-video · 16:9 · 720P · 14 s · fala e boca na mesma passagem

Aquelas quatro linhas saíram da demonstração de trinta segundos da própria Alibaba, que chega aos 2 484 caracteres contra um teto de 20 000. O espaço que sobra é para fixar o orador, o produto e as exclusões — não para escrever mais. Carregar um retrato em vez de descrever um não muda nada na forma como a fala em si se escreve.

Antes de gastares um crédito

Melhora o prompt do teu vídeo com sincronização labial com IA

Uma execução que volta errada quase nunca é um problema do modelo. É um prompt que nomeou a imagem e deixou ao acaso a interpretação, a câmara e a regra das legendas.

O gerador de prompts pega na fala que queres ouvir e devolve um prompt completo do Wan 3.0 à volta dela — o orador fixado, um movimento de câmara nomeado, as camadas de áudio por ordem, e a fala delimitada para ser interpretada e não narrada. Confere o resultado contra as regras que este modelo realmente impõe, por isso a cláusula de que as pessoas se esquecem é acrescentada antes de o crédito ser gasto, e não depois.

  1. 01

    Escreve a fala que precisas de ouvir

    Uma frase chega para começar. Quem a diz e onde pode ser só um fragmento.

  2. 02

    Recebe um prompt construído à volta dela

    Orador, câmara, camadas de som e a fala delimitada, pela ordem em que o Wan 3.0 as lê.

  3. 03

    Envia-o para aqui e acrescenta a cara

    O prompt chega à caixa no topo desta página com a duração e a proporção já definidas.

Abrir o gerador de prompts

Estás a escrever a fala para um anúncio pago e não para uma peça para a câmara? O gerador de anúncios UGC tem a contagem de palavras que quinze segundos aguentam mesmo, e as regras de divulgação que decidem se ele corre.
Já tens um clip cuja interpretação te agradou? O vídeo para prompt transcreve a fala e devolve-a entre chavetas — a forma que este modelo interpreta em vez de narrar.

De uma ponta à outra

Um fluxo de trabalho completo com IA, do guião ao vídeo

Quatro portas para o mesmo sítio. Seja o que for que tens na mão — um parágrafo de guião, uma apresentação, um retrato, ou um clip que já renderizaste — há um caminho daí até uma tomada com alguém a falar, e nenhum deles precisa de uma ferramenta de voz aparafusada ao lado.

  • Um jovem e uma senhora idosa jogam xadrez a uma mesa numa praça movimentada

    Guião → prompt

    Entrega a fala e recebe uma descrição de plano completa construída à volta dela, com o orador fixado e a fala já atribuída a ele.

    Grátis · sem créditos
  • Um camião de longo curso numa autoestrada aberta a desdobrar-se numa máquina que caminha

    Apresentação ou página → guião

    Um PDF ou um URL público passa a ser a história a partir da qual o plano se constrói, em vez de diapositivos com um avatar a lê-los.

    50 páginas · 100 MB
  • Dois homens de fato numa casa de banho de escritório com azulejos, um deles a meio de uma fala

    Retrato + fala → tomada falada

    A cara entra como frame um, a fala entra citada e atribuída, e a boca acompanha-a.

    2–30 s · até 1080P
  • A mesma mulher ruiva mantida ao longo de um plano geral, do interior de um elevador e de um grande plano num átrio comercial

    Fala nova, a mesma tomada

    Muda o que um clip existente diz sem voltar a filmá-lo: o orador, o ritmo e o enquadramento ficam onde estão e o movimento dos lábios é regerado.

    Imagens que já tens

Tudo o que está acima aterra no mesmo sítio — as minhas criações guarda o MP4, o prompt e o id da tarefa de cada execução, por isso uma tomada de que gostaste pode ser reaberta em vez de reconstruída.

O procedimento completo

Como sincronizar os lábios de uma foto com o Wan 3.0

O passo em que as pessoas se enganam é o terceiro: descrever a imagem que o modelo já está a ver, em vez de escrever as palavras que ele não consegue adivinhar.

  1. Larga lá a cara

    A verificação corre instantaneamente, no teu navegador. Um ficheiro bom mostra uma linha verde; um mau nomeia a solução antes de gastares o que quer que seja.

    Verificado sem custo
  2. Cita a fala, e diz quem a diz

    As palavras exatas entre aspas, atribuídas a quem está em câmara. Uma paráfrase — «ela diz qualquer coisa tranquilizadora» — dá-te uma fala inventada pelo modelo.

    Só as palavras exatas
  3. Fecha com «sem legendas»

    Não existe campo de prompt negativo, por isso a instrução para não imprimir a fala é uma frase como as outras. É uma cláusula e poupa uma execução inteira.

    Uma cláusula
  4. Define a duração e a resolução, e gera

    Compra primeiro os segundos de que a fala precisa. Volta um MP4 com a fala, o som de sala e o movimento da boca já lá dentro.

    Até 1080P

Cerca de noventa segundos para um clip curto, e podes fechar o separador enquanto corre. A fotografia carregada nunca é alterada — a saída é um ficheiro novo.

O que significa aqui sincronização labial

A tua fotografia é o frame um. A voz escreve-se, não se carrega.

A maior parte das ferramentas desta categoria pega numa imagem e num ficheiro de áudio e move a boca para acompanhar. Esta pega numa imagem e numa frase.

Um retrato usado como frame de abertura de um clip de sincronização labial do Wan 3.0

Frame 001 · a tua cara

Falado, e sincronizado, daqui para a frente

A sincronização labial do Wan 3.0 mete a tua fotografia lá dentro como literalmente o primeiro frame e gera 2 a 30 segundos para a frente a partir dela, a 30 fps em 480P, 720P ou 1080P. As palavras que citaste voltam como fala na faixa de áudio desse clip, com a boca a mexer-se com elas, porque a imagem e o som são renderizados na mesma passagem em vez de serem cosidos em duas.

A tua foto é o frame um
001

A tua foto é o frame um

Ficheiros de áudio que tens de fornecer
0

Ficheiros de áudio que tens de fornecer

Qualquer segundo inteiro
2–30 s

Qualquer segundo inteiro

MP4 de volta, com o som já lá dentro
1

MP4 de volta, com o som já lá dentro

  • Sem passo de texto para voz antes da renderização
  • Sem passagem de dobragem depois dela
  • Sem um segundo modelo para licenciar por causa da boca

A fala

O que decide se uma fala é dita ou impressa no quadro

Duas frases decidem se uma fala se ouve ou se lê. Uma põe as palavras exatas na boca do orador; a outra mantém-nas fora da imagem. Deixa uma delas de fora e a falha chega em forma de vídeo acabado e cobrado.

A anatomia de uma fala sincronizada

Fala e imagem · uma passagem

…a falar com naturalidade para a câmara. Ela diz:«Tritura tudo até ficar macio.»

Ambiente de cozinha realista, motor a triturar, som de sala informal.Sem legendas, sem texto sobreposto.

Um gato ruivo e um golden retriever de auscultadores a microfones de podcast por baixo de um letreiro de néon ModelTalkDez rondas · 720P · 30 s
Dois oradores, dez rondas, e só abre a boca aquele que está a falar — carrega para ouvires

O que a boca precisa para acertar

3

  • As palavras exatas, citadas e não resumidas
  • Um orador descrito com detalhe suficiente para ficar fixo
  • A câmara na cara dele enquanto fala

A regra que escapa às pessoas

Não existe campo de prompt negativo, por isso «não imprimas isto» é uma frase do prompt como qualquer outra. Deixa-a de fora e o modelo fica livre para tratar o teu diálogo como uma coisa a desenhar no ecrã além de dizer — e é por isso que a demonstração de trinta segundos da própria Alibaba, impressa acima, acaba exatamente nessa instrução.

  • sem legendas, sem texto sobrepostoCerto
  • Prompt negativo: legendasErrado

Tudo o que tenha a forma de um prompt negativo é lido como mais palavras para renderizar, e o pedido continua a resultar — por isso a falha chega como um clip acabado com o rótulo «Prompt negativo» algures no quadro.

As chavetas também funcionam — {like this} é o que as ferramentas de prompt deste site produzem. O que o modelo procura mesmo é uma fala delimitada com um orador visível agarrado a ela, e os prompts publicados pela própria Alibaba usam aspas para isso. O texto para vídeo cobre as quatro camadas de som e a ordem por que se nomeiam.

Antes de gastares

Confere o retrato antes de gastares um crédito

Uma cara que o Wan 3.0 não lê é a maneira mais irritante de perder uma geração, porque só ficas a saber depois da fila e não antes dela. Larga aqui a fotografia e ela é conferida contra os limites reais — formato, tamanho, dimensões, proporção e transparência — com a solução nomeada para a linha que falhar. Não se carrega nada: a verificação corre no teu navegador.

JPG · JPEG · PNG · BMP · WEBP · ≤20.0 MB · 2408,000px · ratio ≤8:1

Uma cara, enquadrada de forma que a boca não seja a coisa mais pequena da imagem, é o que dá mais matéria à sincronização. O verificador nunca toca no modelo, por isso um retrato que nunca ia ser lido não custa nada a descobrir.

O que entra

Limites da sincronização labial do Wan 3.0 — o retrato, o clip e a voz

Cinco destas linhas mandam na fotografia, duas mandam no que sai, e a última é a que produz uma recusa que ninguém espera. A caixa de carregamento no topo desta página confere as linhas da imagem antes de gastares o que quer que seja.

Um primeiro frame fixo e uma gravação de voz não podem viajar juntos. Os frames são uma família de entradas e as referências são a outra; um pedido que traga as duas é recusado logo em vez de ser despromovido, por isso a escolha faz-se antes de carregares.

Formato do retrato
JPEG · JPG · PNG · BMP · WEBPHEIC é recusado — o contentor por omissão de um iPhone não está na lista
Oficial
Tamanho do retrato
≤ 20 MB
Oficial
Dimensões
240 – 8000 px por lado
Oficial
Proporção
8:1 – 1:8Um intervalo, não um teto — uma coluna 1:9 é recusada tal como um banner 9:1
Oficial
Transparência
não aceiteUm canal alfa de PNG é recusado em vez de achatado
Oficial
Duração do clip
2 – 30 s a 30 fpsQualquer número inteiro de segundos, em 480P, 720P ou 1080P
Oficial
Referência de voz
5 faixas · ≤ 15 s no totalWAV ou MP3, até 15 MB cada, 1–15 s por faixa
Oficial
Frames e referências
mutuamente exclusivos
Oficial

A fala em si não tem campo próprio nem limite próprio: vive no prompt com tudo o resto, e o prompt aguenta 20 000 caracteres. O que restringe uma fala é o relógio, não a contagem de caracteres — cerca de dois a três segundos de ecrã por frase curta, por isso uma fala de quinze palavras num clip de quatro segundos ou sai atropelada ou fica cortada. Compra os segundos de que a fala precisa antes de comprares a resolução.

Preços · 1080P em todos os planos pagos · áudio nativo

Quanto custa um clip de sincronização labial do Wan 3.0

A duração e a resolução definem o preço. A fala não: o interruptor do áudio muda o que volta, não o que custa, e uma referência de voz não é cobrada de todo. Uma execução falhada é reembolsada automaticamente, e o verificador acima mantém a maior parte das falhas evitáveis longe do modelo logo à partida.

Como isto é cobrado

Cobrado por
segundo de saída
Fala, referência de voz
sem custo
O teu primeiro clip
grátis · 480P

Esboça a fala em 480P até a interpretação acertar, e depois gasta uma execução em 720P ou 1080P — o retrato não precisa de ser conferido outra vez entre execuções. Preços completos.

Os mesmos créditos mensais nos dois casos

  • Primeiro clip grátisSem cartão

    Uma geração no wan3.0-video verdadeiro. Vê o que o Wan 3.0 faz com um plano teu — 480P, três segundos, som na mesma passagem.

    $0uma vez

    Sem cartão em momento algum

    Gerar clip grátis

    Um e-mail, sem cartão

    1 clip, uma vez

    480P · até 3 s · com som
    Um e-mail, sem cartão

    O mesmo `wan3.0-video` que a Alibaba corre para os planos pagos — 480P é uma resolução, não um modelo inferior

    • O wan3.0-video verdadeiro, não o 2.7
    • Som gerado com a imagem
    • ID do modelo e ID da tarefa no recibo
    • Uma execução falhada nunca te custa
    • 720P e 1080PPago
    • Clips com mais de 3 segundosPago
    • Modos de referência, documento e ediçãoPago
    • Mais do que um clip, alguma vezPago

    Uma pergunta respondida: o que o Wan 3.0 faz com a tua ideia. 1080P, trinta segundos e todos os modos de entrada começam em $12.90.

    Num relance

    Clips por mês
    1, uma vez
    Tomadas por execução
    1
    Clip mais longo
    3s
    Resolução máxima
    480P
  • StarterPoupa até 20%

    Um post de lançamento por semana. Chega para perceberes se o gerador de vídeos com IA Wan 3.0 assenta na tua maneira de trabalhar, sem uma decisão sobre volume.

    $12.90/ mês$15.90

    $154.80 faturados anualmente

    Cancela quando quiseres

    640 créditos / mês · ≈ 16 clips

    a 5 s 480P · 8 a 720P · 4 a 1080P

    Os créditos do plano expiram no fim do mês

    • 640 créditos por mês — cerca de 16 clips terminados
    • 2 tomadas do mesmo prompt por execução
    • Todas as resoluções — 480P, 720P e 1080P
    • Todas as durações — 2 a 30 segundos numa passagem
    • Todas as entradas — texto, imagem, referência, documento, página web
    • Som escrito na mesma passagem, sem marca de água
    • Uso comercial incluído — publica, vende, fatura
    • Wan 3.0 Prime, o nível rápido, sempre que quiseres
    • Uma execução falhada nunca gasta créditos
    • Reembolso em 7 dias enquanto os créditos estiverem por usar
    • Cancela em dois cliques — o preço com que entraste fica travado

    Tudo o que está debaixo das duas primeiras linhas já vem neste plano, por $12.90. Os planos maiores compram segundos e tomadas — nunca um modelo melhor.

    Num relance

    Clips por mês
    ≈ 12 a 5 s 480P
    Tomadas por execução
    2
    Créditos por dólar
    Referência
    Prazo de reembolso
    7 dias
  • É aqui que a maioria assenta
    Pro

    Um clip terminado por cada dia útil, com três alternativas de cada. O ciclo de esboçar a 480P e terminar a 1080P, à medida de uma semana de trabalho.

    $39.90/ mês$49.90

    $478.80 faturados anualmente

    Cancela quando quiseres

    2240 créditos / mês · ≈ 56 clips

    a 5 s 480P · 28 a 720P · 14 a 1080P

    Os créditos do plano expiram no fim do mês

    • 2240 créditos por mês — 3,5× o Starter
    • ≈ 56 clips terminados por mês, ou 14 a 1080P completos
    • 4 tomadas do mesmo prompt por execução — escolhes uma em vez de repetir2× tomadas
    • +13% de créditos por dólar face ao StarterMelhor taxa
    • Espaço para esboçar a 480P e terminar a 1080P na mesma semana
    • Todas as resoluções — 480P, 720P e 1080P
    • Todas as durações — 2 a 30 segundos numa passagem
    • Todas as entradas — texto, imagem, referência, documento, página web
    • Som escrito na mesma passagem, sem marca de água
    • Uso comercial incluído — publica, vende, fatura
    • Wan 3.0 Prime, o nível rápido, sempre que quiseres
    • Uma execução falhada nunca gasta créditos
    • Reembolso em 7 dias enquanto os créditos estiverem por usar
    • Cancela em dois cliques — o preço com que entraste fica travado

    O salto a partir do Starter é quantidade, tomadas e taxa. O modelo, as resoluções e os trinta segundos já eram teus.

    Num relance

    Clips por mês
    ≈ 44 a 5 s 480P
    Tomadas por execução
    4
    Créditos por dólar
    +21% face ao Starter
    Prazo de reembolso
    7 dias
  • StudioMelhor taxa

    Volume de clientes, e o plano em que deixas de racionar 1080P. Trinta e um clips terminados em resolução máxima por mês, ao preço por crédito mais baixo que vendemos.

    $99.90/ mês$119.90

    $1,198.80 faturados anualmente

    Cancela quando quiseres

    6240 créditos / mês · ≈ 156 clips

    a 5 s 480P · 78 a 720P · 39 a 1080P

    Os créditos do plano expiram no fim do mês

    • 6240 créditos por mês — 9,75× o Starter, 2,8× o Pro13×
    • ≈ 156 clips terminados por mês, ou 39 a 1080P completos
    • +26% de créditos por dólar — a melhor taxa que vendemosMelhor taxa
    • 1080P que chegue para deixares de esboçar a 480P primeiro
    • 4 tomadas do mesmo prompt por execução
    • À medida de uma carteira de clientes e não de um canal só
    • Carrega créditos em qualquer mês sem mudar de plano
    • Todas as resoluções — 480P, 720P e 1080P
    • Todas as durações — 2 a 30 segundos numa passagem
    • Todas as entradas — texto, imagem, referência, documento, página web
    • Som escrito na mesma passagem, sem marca de água
    • Uso comercial incluído — publica, vende, fatura
    • Wan 3.0 Prime, o nível rápido, sempre que quiseres
    • Uma execução falhada nunca gasta créditos
    • Reembolso em 7 dias enquanto os créditos estiverem por usar
    • Cancela em dois cliques — o preço com que entraste fica travado

    O plano para uma carteira de clientes e não para um canal só: quatro tomadas de cada prompt, 1080P sem o racionar, e espaço para refazer uma cena sem andar a ver o saldo descer.

    Num relance

    Clips por mês
    ≈ 124 a 5 s 480P
    A 1080P completos
    ≈ 31 por mês
    Créditos por dólar
    +28% face ao Starter
    Prazo de reembolso
    7 dias

Perguntas

Sincronização labial do Wan 3.0 — as perguntas com que as pessoas chegam mesmo

As que vale a pena responder antes de carregares uma cara, com os números tirados da tabela de parâmetros da própria Alibaba e não de uma lista de funcionalidades.

Preciso de um ficheiro de áudio para ter sincronização labial?

Não — por isso podes parar de procurar um. Cita as palavras no prompt e atribui-as a quem está em câmara — She says: "Two minutes to set up." — e o Wan 3.0 gera ele próprio a fala, na mesma passagem que a imagem, com a boca a mexer-se com ela. Uma fotografia e uma frase são a entrada toda. Uma gravação de voz é a outra via, para quando o timbre tem de ser um timbre concreto.

Como escrevo a fala para que seja dita em vez de descrita?

Cita-a e prende-a a alguém. A fórmula de prompt da própria Alibaba põe o conteúdo falado ao lado da emoção, do tom e do sotaque que ele deve levar, e todas as demonstrações desta página seguem-na — She says: "…", e depois a interpretação. Palavras que só ficam resumidas acabam narradas ou inventadas. As ferramentas de prompt deste site envolvem as falas em chavetas, {like this}, que faz o mesmo trabalho de marcar onde a fala começa e acaba.

A minha fala saiu impressa no ecrã em vez de dita. Porquê?

Porque nada no prompt disse para não a imprimir. Não existe campo de prompt negativo neste modelo, por isso as exclusões são frases normais — fecha com «sem legendas, sem texto sobreposto» e a fala sai como áudio. Escrever Negative prompt: subtitles faz o contrário: aquelas palavras passam a ser uma coisa para desenhar.

Posso carregar a minha foto e a minha gravação de voz ao mesmo tempo?

No mesmo pedido, não. Uma fotografia fixada como primeiro frame pertence à família dos frames e uma faixa de áudio pertence à família das referências, e as duas famílias excluem-se — o pedido é recusado em vez de ser despromovido. Escolhe uma: o frame de abertura exato com uma voz gerada, ou a tua voz gravada com a imagem entregue antes como referência.

Que comprimento pode ter a fala?

O suficiente para os segundos que compraste. O campo do prompt aguenta 20 000 caracteres e o clip aguenta 2 a 30 segundos a 30 fps, por isso o que limita é o relógio: a demonstração de trinta segundos da própria Alibaba acima leva seis falas, que dá mais ou menos uma frase curta a cada cinco segundos depois de se contarem os planos de apoio. Uma fala que passe do tempo sai atropelada ou cortada, e nenhum comprimento de prompt resolve isso — compra mais segundos.

Em que línguas é que a sincronização labial funciona?

Em mais do que se imagina, e a prova está nesta página: o clip do terraço acima é a demonstração da própria Alibaba de uma cantora a passar por oito línguas com a sincronização a aguentar, e o clip do dojo corre o diálogo em japonês. O que não existe é uma lista publicada de línguas faladas suportadas nem qualquer parâmetro de bloqueio de fonemas, por isso trata um número concreto citado noutro sítio como um palpite de alguém. Corre três segundos em 480P na língua de que precisas — custa uma fração de um clip bom e responde à pergunta no teu caso.

Podem falar duas pessoas no mesmo clip?

Podem, e o clip do podcast acima são duas a trocar dez rondas. Dá a cada orador um rótulo único e descrição suficiente para se distinguirem, ancora cada fala a alguma coisa que esse orador esteja visivelmente a fazer, e depois escreve as falas pela ordem em que são ditas. A orientação da Alibaba é explícita quanto a os pronomes fundirem oradores — «he says… then he says» é a forma de duas personagens acabarem com uma voz só.

A fala custa mais?

Não. A cobrança é só por segundo de saída e por resolução, por isso um clip com diálogo custa exatamente o que o mesmo clip custa em silêncio. As imagens de referência e o áudio de referência também não são cobrados. A única entrada que acrescenta à conta é um clipe de referência — esses segundos são cobrados ao preço de saída por cima dos segundos que pediste.

O resto da imagem fica quieto enquanto eles falam?

Só se o disseres. A tua fotografia é o frame um, não uma chapa fixa — tudo o que vem depois dela é gerado, por isso a sala, a luz e o enquadramento derivam a não ser que o prompt os fixe. As duas demonstrações da Alibaba acima gastam um parágrafo exatamente nisso, nomeando o que tem de ficar idêntico; o bloqueio de aparência ao lado da caixa do prompt escreve-te a mesma cláusula.

Posso publicar comercialmente um clip falado?

Podes. O uso comercial está incluído em todos os planos pagos, e não há uma licença à parte para comprar, ao abrigo da política de utilização da Alibaba e dos nossos termos. Marca de água não pomos em clip nenhum. O limite não é a licença, é a cara: a pessoa da fotografia e a voz da gravação têm ambas de ter concordado.

Uma cara, uma frase

Carrega o retrato, cita a fala que precisas de ouvir, e ouve o que volta. Um clip Wan 3.0 gratuito a 480P, até três segundos — um e-mail, sem cartão. Se a interpretação não for a que imaginaste, não te custou nada.

Escrito e mantido pela equipa editorial de wan-3.runPublicado a Atualizado a Ferramenta versão 2026.09.4