Wan 3.0 Vídeo con Sincronización Labial

Suelta una cara, cita la frase y la boca sigue a las palabras. Wan 3.0 sincronización labial genera la voz en la misma pasada que la imagen, así que no hay archivo de audio que grabar antes ni pasada de doblaje después. De dos a treinta segundos, sonido dentro del MP4, y tu primer clip es gratis.

El hablante

Crear imagen

JPG · PNG · BMP · WEBP · ≤20 MB · 240–8000 px · relación ≤8:1

0 / 20000

El hablante mantiene la misma cara, el mismo pelo, la misma ropa y los mismos colores en todo momento; solo cambian la cámara y el movimiento descrito.

Model
Aspect ratio
Duration
Resolution
Regístrate gratis · 1 clip en Wan 3.0

El clip gratis es el mismo Wan 3.0 con su sonido, limitado a 480P · 3s, y se pone en cola en capacidad compartida. Un plan sube el techo a 1080P y treinta segundos: la capa gratuita es una resolución, no un modelo distinto.

1 clip gratis en el modelo real · un correo, sin tarjeta · encender el sonido cuesta lo mismo que dejarlo apagado

Las propias demos de diálogo de Wan 3.0 de Alibaba · Probar esto carga el prompt

Una mujer en la encimera de una cocina sosteniendo una batidora portátil rosa, hablando directamente a cámaraHABLADO A CÁMARA · 9:16 · 720P

Una pieza a cámara, de seis frases

Qué vuelve

Qué hace Wan 3.0 cuando el prompt lleva una frase dentro

Todos los clips de aquí son demos que Alibaba publicó para Wan 3.0, y cada uno llegó con el prompt que lo produjo. Pulsa Escúchalo para la voz, o Usar prompt para cargarlo entero en la casilla de arriba de esta página: impreso completo y en el idioma en que se escribió.

  • 1 pasadaimagen, voz y movimiento de boca en una sola generación
  • $0de más por la pista de audio
  • wan3.0-videoel modelo detrás de cada clip de esta banda
  • Una mujer en la encimera de una cocina sosteniendo una batidora portátil rosa, hablando directamente a cámaraReferencia
    Seis frases a cámara, con el producto sostenido por una imagen de referencia
  • Una cantante en el centro de un escenario en una azotea de noche con un DJ detrás y el perfil de la ciudad al fondoReferencia
    Una cantante cambiando de idioma, con la sincronización aguantando en los ocho
  • Un hombre con un abrigo gris largo y gafas de protección de pie en un dojo de madera iluminado por el solReferencia
    Dos hablantes, en japonés, una frase cada uno y sin solaparse
  • Un gato naranja y un golden retriever con auriculares ante micrófonos de pódcast bajo un rótulo de neón que dice ModelTalkPrimer fotograma
    Una imagen fija de dos animales se convierte en diez rondas de diálogo

Qué hace que una frase hablada cuadre

  • Las palabras

    Cita la frase exacta. Una paráfrasis te da una frase que se inventó el modelo.

  • Hablante

    Fija quién habla — edad, pelo, ropa — o se moverá la boca equivocada.

  • Cámara

    Mantenla en la cara durante toda la frase.

  • Texto

    Cierra con sin subtítulos, o la frase puede llegar impresa sobre el encuadre.

Desde un prompt de texto

Genera vídeo con sincronización labial por IA desde prompts de texto sencillos

Sin formato de guion, sin línea de tiempo y sin archivo de voz. Describe el plano en frases corrientes, cita las palabras que dice el personaje y atribúyeselas a la persona que sale en cámara, y Wan 3.0 renderiza la imagen, sintetiza la voz y le mueve la boca en una sola petición.

Un prompt, una frase hablada

Plano medio principal. La mujer está detrás de la encimera de la cocina
sosteniendo la batidora portátil rosa, hablando con naturalidad a cámara.
Ella dice: «Me preguntan mucho cómo hago los batidos tan rápido.»
Sin subtítulos, sin rótulos, sin interfaz, sin marca de agua.

  • Plano, cámara y quién habla
  • La frase citada, y qué no imprimir
2484 / 20,000

Una pasada de salida

Una mujer en la encimera de una cocina sosteniendo una batidora portátil rosa, hablando directamente a cámara9:16 · 720P · 30S

wan3.0-video · 16:9 · 720P · 14s · voz y boca en la misma pasada

Esas cuatro líneas están sacadas de la propia demo de treinta segundos de Alibaba, que ocupa 2 484 caracteres frente a un techo de 20 000. El espacio es para fijar al hablante, el producto y las exclusiones, no para escribir más. Subir un retrato en lugar de describir uno no cambia nada de cómo se escribe la frase.

Antes de gastar un crédito

Mejora el prompt de tu vídeo con sincronización labial con IA

Una ejecución que vuelve mal casi nunca es un problema del modelo. Es un prompt que nombró la imagen y dejó al azar la interpretación, la cámara y la regla de los subtítulos.

El generador de prompts toma la frase que quieres que se diga y devuelve un prompt completo de Wan 3.0 construido a su alrededor: el hablante fijado, un movimiento de cámara nombrado, las capas de audio ordenadas y la frase delimitada para que se interprete en lugar de narrarse. Comprueba el resultado contra las reglas que este modelo impone de verdad, así que la cláusula que la gente olvida se añade antes de gastar el crédito y no después.

  1. 01

    Escribe la frase que necesitas que se diga

    Con una frase basta para empezar. Quién la dice y dónde puede ser un fragmento.

  2. 02

    Recibe un prompt construido a su alrededor

    Hablante, cámara, capas de sonido y la frase delimitada, en el orden en que las lee Wan 3.0.

  3. 03

    Envíalo aquí y añade la cara

    El prompt llega a la casilla de arriba de esta página con la duración y la relación ya puestas.

Abrir el generador de prompts

¿Estás escribiendo la frase para un anuncio de pago y no para una pieza a cámara? El generador de anuncios UGC tiene el número de palabras que aguantan de verdad quince segundos, y las normas de divulgación que deciden si se puede emitir.
¿Ya tienes un clip cuya interpretación te gustó? Vídeo a prompt transcribe la frase hablada y te la devuelve entre llaves: la forma que este modelo interpreta en lugar de narrar.

De principio a fin

Un flujo de trabajo con IA completo, del guion al vídeo

Cuatro puertas al mismo endpoint. Tengas lo que tengas — un párrafo de guion, una presentación, un retrato o un clip que ya renderizaste —, hay una ruta desde ahí hasta una toma hablada, y ninguna necesita una herramienta de voz aparte atornillada al lado.

  • Un joven y una anciana juegan al ajedrez en una mesa en una plaza concurrida

    Guion → prompt

    Entrega la frase y recibe una descripción de plano completa construida a su alrededor, con el hablante fijado y la frase ya atribuida a él.

    Gratis · sin créditos
  • Un camión de largo recorrido en una autopista abierta desplegándose en una máquina que camina

    Presentación o página → guion

    Un PDF o una URL pública se convierte en la historia sobre la que se construye el plano, en vez de diapositivas con un avatar leyéndolas.

    50 páginas · 100 MB
  • Dos hombres trajeados en el aseo alicatado de una oficina, uno de ellos a media frase

    Retrato + frase → toma hablada

    La cara entra como fotograma uno, la frase entra citada y atribuida, y la boca la sigue.

    2–30 s · hasta 1080P
  • La misma mujer pelirroja sostenida en un plano general, en el interior de un ascensor y en un primer plano dentro de un atrio comercial

    Frase nueva, misma toma

    Cambia lo que dice un clip existente sin volver a rodarlo: el hablante, el ritmo y el encuadre se quedan donde estaban y el movimiento de los labios se regenera.

    Metraje que ya tienes

Todo lo de arriba aterriza en el mismo sitio: mis creaciones guarda el MP4, el prompt y el ID de tarea de cada ejecución, así que una toma que te gustó se puede volver a abrir en lugar de reconstruirla.

El procedimiento entero

Cómo sincronizar los labios de una foto con Wan 3.0

El paso que la gente hace mal es el tercero: describir la imagen que el modelo ya ve, en lugar de escribir las palabras que no puede adivinar.

  1. Suelta la cara

    La comprobación es instantánea y ocurre en tu navegador. Un archivo bueno muestra una fila verde; uno malo nombra la solución antes de que gastes nada.

    Comprobado gratis
  2. Cita la frase, y di quién la dice

    Las palabras exactas entre comillas, atribuidas a la persona que sale en cámara. Una paráfrasis — «ella dice algo tranquilizador» — te da una frase que se inventó el modelo.

    Solo palabras exactas
  3. Cierra con «sin subtítulos»

    No hay campo de prompt negativo, así que la instrucción de no imprimir la frase es una frase como las demás. Es una cláusula y salva una ejecución entera.

    Una cláusula
  4. Fija duración y resolución, y genera

    Compra primero los segundos que necesita la frase. Vuelve un solo MP4 con la voz, el sonido de sala y el movimiento de boca ya dentro.

    Hasta 1080P

Alrededor de noventa segundos para un clip corto, y puedes cerrar la pestaña mientras se ejecuta. La fotografía subida no se modifica nunca: la salida es un archivo nuevo.

Qué significa aquí sincronización labial

Tu fotografía es el fotograma uno. La voz se escribe, no se sube.

Casi todas las herramientas de esta categoría admiten una imagen y un archivo de audio y mueven la boca para que encaje. Esta admite una imagen y una frase.

Un retrato usado como fotograma de apertura de un clip de sincronización labial de Wan 3.0

Fotograma 001 · tu cara

Hablado, y sincronizado, de aquí en adelante

Wan 3.0 sincronización labial mete tu fotografía como primer fotograma literal y genera de 2 a 30 segundos hacia delante desde ahí, a 30 fps en 480P, 720P o 1080P. Las palabras que citaste vuelven como voz en la propia pista de audio de ese clip, con la boca moviéndose con ellas, porque la imagen y el sonido se renderizan en la misma pasada en lugar de coserse en dos.

Tu foto es el fotograma uno
001

Tu foto es el fotograma uno

Archivos de audio que tienes que aportar
0

Archivos de audio que tienes que aportar

Cualquier segundo entero
2–30 s

Cualquier segundo entero

Un MP4 de vuelta, con el sonido ya dentro
1

Un MP4 de vuelta, con el sonido ya dentro

  • Sin paso de texto a voz antes del render
  • Sin pasada de doblaje después
  • Sin un segundo modelo que licenciar para la boca

La frase

Qué decide si una frase se habla o se imprime sobre el encuadre

Dos frases deciden si una línea se oye o se lee. Una pone las palabras exactas en boca del hablante; la otra las mantiene fuera de la imagen. Deja cualquiera de las dos fuera y el fallo llega como vídeo terminado y facturado.

La anatomía de una frase sincronizada

Voz e imagen · una pasada

…hablando con naturalidad a cámara. Ella dice:«Lo tritura todo hasta dejarlo suave.»

Ambiente de cocina realista, motor de la batidora, sonido de sala informal.Sin subtítulos, sin rótulos.

Un gato naranja y un golden retriever con auriculares ante micrófonos de pódcast bajo un rótulo de neón que dice ModelTalkDiez rondas · 720P · 30s
Dos hablantes, diez rondas, y solo abre la boca el que está hablando — pulsa para oírlo

Lo que necesita la boca para cuadrar

3

  • Las palabras exactas, citadas en lugar de resumidas
  • Un hablante descrito con la precisión suficiente para fijarlo
  • La cámara en su cara mientras habla

La regla que se le escapa a la gente

No hay campo de prompt negativo, así que «no imprimas esto» es una frase del prompt como cualquier otra. Déjala fuera y el modelo es libre de tratar tu diálogo como algo que renderizar en pantalla además de hablarlo, y por eso la propia demo de treinta segundos de Alibaba, impresa arriba, termina con esa instrucción exacta.

  • sin subtítulos, sin rótulosBien
  • Prompt negativo: subtítulosMal

Cualquier cosa con forma de prompt negativo se lee como más palabras que renderizar, y la petición se completa igual, así que el fallo llega como un clip terminado con la etiqueta «Negative prompt» en algún lugar del encuadre.

Las llaves también valen: {like this} es lo que emiten las herramientas de prompts de este sitio. Lo que el modelo busca en realidad es una frase delimitada con un hablante visible atado a ella, y los prompts publicados por la propia Alibaba usan comillas para eso. Texto a vídeo cubre las cuatro capas de sonido y el orden en que nombrarlas.

Antes de gastar

Comprueba el retrato antes de gastar un crédito

Una cara que Wan 3.0 no va a leer es la forma más molesta de perder una generación, porque te enteras después de la cola y no antes. Suelta aquí la fotografía y se comprueba contra los límites reales — formato, tamaño, dimensiones, relación y transparencia — con la solución nombrada para la fila que falle. No se sube nada: la comprobación se ejecuta en tu navegador.

JPG · JPEG · PNG · BMP · WEBP · ≤20.0 MB · 2408,000px · ratio ≤8:1

Una sola cara, encuadrada de modo que la boca no sea lo más pequeño de la imagen, le da a la sincronización con lo que trabajar. El comprobador nunca toca el modelo, así que averiguar que un retrato no iba a poder leerse no cuesta nada.

Qué entra

Límites de Wan 3.0 sincronización labial — el retrato, el clip y la voz

Cinco de estas filas gobiernan la fotografía, dos gobiernan lo que sale, y la última es la que produce un rechazo que nadie espera. La casilla de subida de arriba comprueba las filas de imagen antes de que gastes nada.

Un primer fotograma fijado y una grabación de voz no pueden viajar juntos. Los fotogramas son una familia de entradas y las referencias son la otra; una petición que lleve las dos se rechaza sin más en lugar de degradarse, así que la elección ocurre antes de subir nada.

Formato del retrato
JPEG · JPG · PNG · BMP · WEBPEl HEIC se rechaza: el contenedor por defecto del iPhone no está en la lista
Oficial
Tamaño del retrato
≤ 20 MB
Oficial
Dimensiones
240 – 8 000 px por lado
Oficial
Relación de aspecto
8:1 – 1:8Un rango, no un techo: una columna 1:9 se rechaza igual que un banner 9:1
Oficial
Transparencia
no se aceptaUn canal alfa de PNG se rechaza en lugar de aplanarse
Oficial
Duración del clip
2 – 30 s a 30 fpsCualquier número entero de segundos, en 480P, 720P o 1080P
Oficial
Referencia de voz
5 pistas · ≤ 15 s en totalWAV o MP3, hasta 15 MB cada una, 1–15 s por pista
Oficial
Fotogramas y referencias
mutuamente excluyentes
Oficial

La frase en sí no tiene campo aparte ni límite aparte: vive en el prompt con todo lo demás, y el prompt admite 20 000 caracteres. Lo que limita una frase hablada es el reloj, no el recuento de caracteres: alrededor de dos o tres segundos de pantalla por frase corta, así que una frase de quince palabras en un clip de cuatro segundos sale atropellada o se corta. Compra los segundos que necesita la frase antes de comprar la resolución.

Precios · 1080P en todos los planes de pago · Audio nativo

Lo que cuesta un clip de Wan 3.0 sincronización labial

La duración y la resolución fijan el precio. La voz no: el interruptor de audio cambia lo que vuelve, no lo que cuesta, y una referencia de voz no se cobra en absoluto. Una ejecución fallida se reembolsa automáticamente, y el comprobador de arriba mantiene la mayoría de los fallos evitables lejos del modelo desde el principio.

Cómo se cobra esto

Se cobra por
segundo de salida
Voz, referencia de voz
sin cargo
Tu primer clip
gratis · 480P

Boceta la frase en 480P hasta que la interpretación cuadre y después gasta una ejecución en 720P o 1080P: el retrato no hay que volver a comprobarlo entre ejecuciones. Precios completos.

Los mismos créditos al mes en ambos casos

  • Primer clip gratisSin tarjeta

    Una generación en el wan3.0-video real. Mira qué hace Wan 3.0 con un plano tuyo: 480P, tres segundos, sonido en la misma pasada.

    $0una vez

    Sin tarjeta en ningún momento

    Generar clip gratis

    Un correo, sin tarjeta

    1 clip, una vez

    480P · hasta 3 s · con sonido
    Un correo, sin tarjeta

    El mismo `wan3.0-video` que Alibaba ejecuta para los planes de pago: 480P es una resolución, no un modelo inferior

    • El wan3.0-video real, no el 2.7
    • Sonido generado junto a la imagen
    • ID de modelo e ID de tarea en el recibo
    • Una ejecución fallida nunca te cuesta
    • 720P y 1080PDe pago
    • Clips de más de 3 segundosDe pago
    • Modos de referencia, documento y ediciónDe pago
    • Más de un clip, nuncaDe pago

    Una pregunta respondida: qué hace Wan 3.0 con tu idea. 1080P, treinta segundos y todos los modos de entrada empiezan en $12.90.

    De un vistazo

    Clips al mes
    1, una vez
    Tomas por ejecución
    1
    Clip más largo
    3s
    Resolución máxima
    480P
  • StarterAhorra hasta un 20 %

    Una publicación de lanzamiento a la semana. Suficiente para averiguar si el generador de vídeos con IA Wan 3.0 encaja con tu forma de trabajar, sin tener que decidir nada sobre volumen.

    $12.90/ mes$15.90

    $154.80 facturados al año

    Cancela cuando quieras

    640 créditos / mes · ≈ 16 clips

    de 5 s en 480P · 8 en 720P · 4 en 1080P

    Los créditos del plan caducan a fin de mes

    • 640 créditos al mes, unos 16 clips terminados
    • 2 tomas de un mismo prompt por ejecución
    • Todas las resoluciones: 480P, 720P y 1080P
    • Todas las duraciones: de 2 a 30 segundos en una pasada
    • Todas las entradas: texto, imagen, referencia, documento, página web
    • Sonido escrito en la misma pasada, sin marca de agua
    • Uso comercial incluido: publícalo, véndelo, factúralo
    • Wan 3.0 Prime, la capa rápida, cuando quieras
    • Una ejecución fallida nunca cuesta créditos
    • Reembolso de 7 días mientras los créditos estén sin tocar
    • Cancela en dos clics: el precio al que entraste queda bloqueado

    Todo lo que hay bajo las dos primeras líneas está en este plan por $12.90. Los planes mayores compran segundos y tomas, nunca un modelo mejor.

    De un vistazo

    Clips al mes
    ≈ 12 de 5 s en 480P
    Tomas por ejecución
    2
    Créditos por dólar
    Referencia
    Plazo de reembolso
    7 días
  • Aquí acaba casi todo el mundo
    Pro

    Un clip terminado cada día laborable, con tres alternativas de cada uno. El bucle de bocetar en 480P y terminar en 1080P, dimensionado para una semana de trabajo.

    $39.90/ mes$49.90

    $478.80 facturados al año

    Cancela cuando quieras

    2 240 créditos / mes · ≈ 56 clips

    de 5 s en 480P · 28 en 720P · 14 en 1080P

    Los créditos del plan caducan a fin de mes

    • 2 240 créditos al mes, 3,5× Starter
    • ≈ 56 clips terminados al mes, u 14 en 1080P completo
    • 4 tomas de un mismo prompt por ejecución: eliges una en vez de volver a tirar2× tomas
    • Un 21 % más de créditos por dólar que StarterMejor tarifa
    • Margen para bocetar en 480P y terminar en 1080P la misma semana
    • Todas las resoluciones: 480P, 720P y 1080P
    • Todas las duraciones: de 2 a 30 segundos en una pasada
    • Todas las entradas: texto, imagen, referencia, documento, página web
    • Sonido escrito en la misma pasada, sin marca de agua
    • Uso comercial incluido: publícalo, véndelo, factúralo
    • Wan 3.0 Prime, la capa rápida, cuando quieras
    • Una ejecución fallida nunca cuesta créditos
    • Reembolso de 7 días mientras los créditos estén sin tocar
    • Cancela en dos clics: el precio al que entraste queda bloqueado

    El salto desde Starter es cantidad, tomas y tarifa. El modelo, las resoluciones y los treinta segundos ya eran tuyos.

    De un vistazo

    Clips al mes
    ≈ 44 de 5 s en 480P
    Tomas por ejecución
    4
    Créditos por dólar
    +21 % frente a Starter
    Plazo de reembolso
    7 días
  • StudioMejor tarifa

    Volumen de clientes, y el plan en el que dejas de racionar el 1080P. Treinta y un clips terminados a resolución completa al mes, al precio por crédito más bajo que vendemos.

    $99.90/ mes$119.90

    $1,198.80 facturados al año

    Cancela cuando quieras

    6 240 créditos / mes · ≈ 156 clips

    de 5 s en 480P · 78 en 720P · 39 en 1080P

    Los créditos del plan caducan a fin de mes

    • 6 240 créditos al mes, 9,75× Starter y 2,8× Pro13×
    • ≈ 156 clips terminados al mes, o 39 en 1080P completo
    • Un 28 % más de créditos por dólar: la mejor tarifa que vendemosMejor tarifa
    • 1080P suficiente como para dejar de bocetar antes en 480P
    • 4 tomas de un mismo prompt por ejecución
    • Dimensionado para una cartera de clientes y no para un solo canal
    • Recarga cualquier mes sin cambiar de plan
    • Todas las resoluciones: 480P, 720P y 1080P
    • Todas las duraciones: de 2 a 30 segundos en una pasada
    • Todas las entradas: texto, imagen, referencia, documento, página web
    • Sonido escrito en la misma pasada, sin marca de agua
    • Uso comercial incluido: publícalo, véndelo, factúralo
    • Wan 3.0 Prime, la capa rápida, cuando quieras
    • Una ejecución fallida nunca cuesta créditos
    • Reembolso de 7 días mientras los créditos estén sin tocar
    • Cancela en dos clics: el precio al que entraste queda bloqueado

    El plan para una cartera de clientes y no para un solo canal: cuatro tomas de cada prompt, 1080P sin racionarlo y margen para repetir una escena sin mirar cómo baja el saldo.

    De un vistazo

    Clips al mes
    ≈ 124 de 5 s en 480P
    En 1080P completo
    ≈ 31 al mes
    Créditos por dólar
    +28 % frente a Starter
    Plazo de reembolso
    7 días

Preguntas

Wan 3.0 sincronización labial: las preguntas con las que la gente llega de verdad

Las que merece la pena responder antes de subir una cara, con las cifras tomadas de la propia tabla de parámetros de Alibaba y no de una lista de funciones.

¿Necesito un archivo de audio para tener sincronización labial?

No, así que puedes dejar de buscarlo. Cita las palabras en el prompt y atribúyeselas a la persona que sale en cámara — She says: "Two minutes to set up." — y Wan 3.0 genera la voz él mismo, en la misma pasada que la imagen y con la boca moviéndose con ella. Una fotografía y una frase son toda la entrada. Una grabación de voz es la otra vía, para cuando el timbre tiene que ser uno concreto.

¿Cómo escribo la frase para que se hable en lugar de describirse?

Cítala y atribúyesela a alguien. La propia fórmula de prompts de Alibaba pone el contenido hablado junto a la emoción, el tono y el acento que debe llevar, y todas las demos de esta página lo siguen — She says: "…", y después la interpretación. Las palabras que solo se resumen acaban narradas o inventadas. Las herramientas de prompts de este sitio envuelven las frases entre llaves, {like this}, que hace el mismo trabajo de marcar dónde empieza y dónde acaba la frase.

Mi frase salió impresa en pantalla en lugar de hablada. ¿Por qué?

Porque nada en el prompt decía que no lo imprimiera. Este modelo no tiene campo de prompt negativo, así que las exclusiones son frases corrientes: cierra con «sin subtítulos, sin rótulos» y la frase se renderiza como audio. Escribir Negative prompt: subtitles hace lo contrario: esas palabras se convierten en algo que dibujar.

¿Puedo subir mi foto y mi grabación de voz a la vez?

No en una misma petición. Una fotografía fijada como primer fotograma pertenece a la familia de fotogramas y una pista de audio pertenece a la de referencias, y las dos familias son mutuamente excluyentes: la petición se rechaza en lugar de degradarse. Elige una: el fotograma de apertura exacto con una voz generada, o tu voz grabada con la imagen adjunta como referencia.

¿Cuánto puede durar la frase?

Lo bastante larga para los segundos que compraste. El campo del prompt admite 20 000 caracteres y el clip admite de 2 a 30 segundos a 30 fps, así que la restricción es el reloj: la propia demo de treinta segundos de Alibaba de arriba mete seis frases habladas, que son más o menos una frase corta cada cinco segundos una vez contados los planos de recurso. Una frase que se pasa sale atropellada o cortada, y ninguna longitud de prompt arregla eso: compra más segundos.

¿En qué idiomas funciona la sincronización labial?

Más de lo que imaginarías, y la prueba está en esta página: el clip de la azotea de arriba es la propia demo de Alibaba de una cantante cambiando entre ocho idiomas con la sincronización aguantando, y el clip del dojo lleva su diálogo en japonés. Lo que no existe es una lista publicada de idiomas de voz admitidos ni ningún parámetro de bloqueo de fonemas, así que trata cualquier número concreto citado por ahí como la suposición de alguien. Ejecuta tres segundos en 480P en el idioma que necesites: cuesta una fracción de un clip definitivo y responde a la pregunta para tu caso.

¿Pueden hablar dos personas en el mismo clip?

Sí, y el clip del pódcast de arriba son dos intercambiando diez rondas. Dale a cada hablante una etiqueta única y descripción suficiente para distinguirlo, ancla cada frase a algo que ese hablante esté haciendo visiblemente, y después escribe las frases en el orden en que se dicen. La guía de Alibaba es explícita en que los pronombres funden a los hablantes: «él dice… y después él dice» es como dos personajes acaban con una sola voz.

¿La voz cuesta más?

No. La facturación es solo por segundo de salida y resolución, así que un clip con diálogo cuesta exactamente lo mismo que el mismo clip en silencio. Las imágenes de referencia y el audio de referencia tampoco se cobran. La única entrada que sí suma a la factura es un clip de referencia: esos segundos se cobran a la tarifa de salida encima de los segundos que pediste.

¿El resto de la imagen se queda quieta mientras habla?

Solo si lo dices. Tu fotografía es el fotograma uno, no una placa fija: todo lo que viene después se genera, así que la sala, la luz y el encuadre derivan salvo que el prompt los fije. Las dos demos de Alibaba de arriba dedican un párrafo exactamente a eso, nombrando qué tiene que quedarse idéntico; el bloqueo de apariencia que hay junto a la casilla del prompt escribe esa misma cláusula por ti.

¿Puedo publicar comercialmente un clip hablado?

Sí. El uso comercial está incluido en todos los planes de pago, y no ponemos marca de agua ni hay ninguna licencia aparte que comprar, bajo la política de uso de Alibaba y nuestros términos. El límite no es la licencia, es la cara: la persona de la fotografía y la voz de la grabación tienen que haber dado su consentimiento.

Una cara, una frase

Sube el retrato, cita la frase que necesitas que se diga y escucha lo que vuelve. Un clip gratis de Wan 3.0 en 480P, hasta tres segundos: un correo, sin tarjeta. Si la interpretación no es la que imaginabas, no te ha costado nada.

Escrito y mantenido por el equipo editorial de wan-3.runPublicado el Actualizado el Herramienta versión 2026.09.4