Wan 3.0 Texto a Vídeo
Treinta segundos, con sonido
Entra un prompt, sale un clip terminado, sin ninguna aplicación de edición por medio. Wan 3.0 de texto a vídeo funciona de 2 a 30 segundos en 480P, 720P o 1080P y escribe el diálogo, los efectos y la música en el mismo archivo que la imagen. El primero es gratis, y corre sobre el modelo real y no sobre el del año pasado.
Seis prompts de Wan 3.0 de texto a vídeo y los clips que produjeron, y después el resto de la biblioteca · pulsa Probar esto para cargar uno
12s · 16:9 · 720PBailarinas en niebla a contraluz
Lo que Wan 3.0 de texto a vídeo te da realmente
Wan 3.0 de texto a vídeo toma un prompt escrito de hasta 20 000 caracteres y devuelve un único MP4 de 2 a 30 segundos a 30 fps, en 480P, 720P o 1080P, con voz, efectos de sonido y música generados en la misma pasada. No hay un paso de audio aparte ni una fase de escalado.
Una mujer camina por una calle.
El modelo rellenó el resto
- ¿a qué hora del día?
- ¿qué lleva puesto?
- ¿de dónde viene la luz?
- ¿hacia dónde se mueve la cámara?
- ¿a qué suena?
- ¿cómo termina?
Wan 3.0 · 16:9 · 720P · 5sSeis respuestas que no diste, elegidas por ti. No es que el modelo sea poco servicial: un prompt es una especificación, y cada pregunta que deja abierta es una que Wan 3.0 tiene que cerrar por su cuenta. El espacio para responderlas es toda la diferencia: 20 000 caracteres es mucho más de lo que necesita cualquier plano, y el briefing de sonido vive en el mismo campo que la imagen.
- Caracteres que puedes escribir
- 20,000
- Cualquier número entero
- 2–30 s
- En todos los niveles
- 30 fps
- Resoluciones: 480P · 720P · 1080P
- 3
- Imagen y sonido juntos
- 1 pasada
Caracteres que puedes escribir
Cualquier número entero
En todos los niveles
Resoluciones: 480P · 720P · 1080P
Imagen y sonido juntos
- Sin imagen de partida
- Sin paso de audio aparte
- Sin fase de escalado
Cinco segundos y treinta segundos son
prompts distintos de Wan 3.0
Esto es lo primero que la gente hace mal. Un clip corto de Wan 3.0 quiere una acción descrita con precisión. Uno largo quiere tiempos en orden, y si dejas el último tercio sin asignar, el modelo lo rellena con lo que le parezca. Abajo hay tres clips reales, uno por duración, con el prompt que hizo cada uno.
5 segundos
una acción

One subject, one action, one framing. Do not describe a change — there is no room to deliver one.
Se sostiene
Tres tiempos escritos en cinco segundos y el modelo elige el más fuerte. Pide uno y recibes el que pediste.
12 segundos
tiempos, en orden

Two or three beats with the order stated. Then, after that, finally — connectives are the only scheduling grammar there is.
Se resuelve
Bastante largo para que una forma llegue, se mantenga y se vaya. Bastante corto para que no quepa una historia, y Wan 3.0 no tiene gramática de códigos de tiempo, así que el orden tiene que ser palabras.
15 segundos
tiempos, y un final

Give every beat one job and write the last one down. An unplanned final third is the most common way a long clip goes wrong.
Aterriza
Cuatro tiempos, y el cuarto existe solo para que el modelo no tenga que inventarse una manera de parar.
El rango va de 2 a 30 segundos, cualquier número entero, en una sola toma continua. Bocetar en 480P cuesta la cuarta parte que 1080P por los mismos segundos, así que encuentra la duración en 480P y gasta la resolución una sola vez. Cada uno de estos prompts está impreso entero en ideas de prompts.
Construye un prompt de Wan 3.0 con
la fórmula de la propia Alibaba
Rellena las casillas, mira cómo se monta el prompt y envíalo directo al generador.
Alibaba publica la forma que debería tener un prompt de Wan 3.0: entidad, luego escena, luego movimiento, luego control estético, luego estilización, con el sonido escrito al lado. Casi toda esa forma se pierde al parafrasearla en prosa. Estas casillas la conservan, y ninguno de los nombres de campo llega al modelo, porque Wan 3.0 lee un solo párrafo llano y renderiza cualquier cosa que parezca una etiqueta.
El orden importa
Dónde van las palabras
Entidad, escena, movimiento — qué está pasando
Quién o qué está en el encuadre, dónde está y qué se mueve.
- Entidad
- Escena
- Movimiento
Escríbelo en ese orden, en frases llanas. Describe al sujeto de forma bastante concreta para poder imaginarlo, dale al lugar una hora del día y una fuente de luz, y di qué se mueve, cuánto y a qué velocidad. La quietud cuenta como respuesta: una cámara que nunca mencionas es una cámara que el modelo puede mover a su antojo.
Control estético, estilización — cómo está rodado
Tamaño de plano, movimiento de cámara, objetivo, luz; y después un look con nombre, si el plano lo necesita.
- Control estético
- Estilización
Una sola cláusula separada por comas que lleve el encuadre, el movimiento de cámara con su amplitud y su velocidad, el objetivo y la luz. La estilización va al final y es opcional: un género arrastra consigo toda una gramática de cobertura, así que tres palabras de estilización valen un párrafo de descripción.
Sonido — la misma pasada
Diálogo, efectos, ambiente, música; y los silencios.
- Diálogo
- Efectos
- Ambiente
- Música
Wan 3.0 escribe el audio junto a la imagen, así que esto es un briefing de sonido y no una ocurrencia de última hora. Nombra las capas por separado, pon las frases habladas entre llaves y di qué no quieres oír: no hay campo de prompt negativo, así que «sin música» es una frase.
Prompt montado, en vivo
Entidad, escena, movimiento
Un repartidor con una chaqueta amarilla empapada empuja una puerta con el hombro y sale a un callejón estrecho de noche, con el neón derramándose sobre el ladrillo mojado.
Control estético, estilización
Plano medio, la cámara entra despacio, un movimiento pequeño, 35 mm, poca profundidad de campo, luz práctica dura.
Sonido
Lluvia sobre tela y asfalto, la bisagra de una puerta, tráfico lejano. Sin música.
0 / 20000
Las casillas son el orden en el que componemos. Las etiquetas nunca llegan al modelo.
Qué hace Wan 3.0 con ello
- 01Una sola cadena llana, de hasta 20 000 caracteres
- 02Sin nombres de campo, sin marcas de plano, sin códigos de tiempo
- 03El diálogo se interpreta cuando es {la frase exacta}
- 04Las exclusiones se escriben como frases, no en un campo negativo
- 05El audio se genera en la misma pasada y al mismo precio
¿Prefieres no escribir nada de esto? El generador de prompts lo construye entero a partir de una sola línea, gratis y sin contador. O empieza por once prompts que ya produjeron clips.
Nombra el movimiento de cámara y tendrás la sensación
Escribe cinematográfico y no pasa nada: no hay nada dentro que ejecutar. Wan 3.0 quiere un movimiento, y lo sigue mucho más de cerca cuando ese movimiento lleva una amplitud y una velocidad.
push in / pull out / tracking shot / arc shot / tilt up / pan across / static shot
a small move / a large move
slowly / quickly
Se mueve
slowly push in, a small move
trabajo de cámara cinematográfico
Nada que ejecutar
starts with close-ups, then gently circles both playersUna secuencia, no un horario. Empieza con… después… es toda la gramática.
rising slowly from ground level as the machine standsEl movimiento está atado a la acción, así que no puede desincronizarse de ella.
a slow push in that stops before the centre dancer fills the frameUn movimiento con una condición de final en lugar de un tiempo. Más robusto que cualquiera de los dos.
Dónde ocurre el movimiento
Más allá de la duración que fijaste: el modelo comprime en lugar de alargar
La duración que fijaste termina aquí
Wan 3.0 no tiene gramática de códigos de tiempo. El orden viene de los conectores — después, a continuación, por último — y la forma más fiable de programar un movimiento de cámara es atarlo a una acción en lugar de a un momento, porque un movimiento atado a una acción se comprime con ella en vez de desincronizarse.
¿Ya tienes metraje y prefieres reestilizarlo antes que reescribirlo? Eso es la edición de vídeo de Wan 3.0. ¿Necesitas el mismo sujeto en varios clips? Referencia a vídeo.
Escribir diálogo y sonido dentro de
un prompt de Wan 3.0
Wan 3.0 genera el audio junto a la imagen en la misma petición, lo que significa que el campo del prompt es también el briefing de sonido, y cuesta exactamente lo mismo lo escribas o no. No digas nada y seguirás recibiendo una banda sonora; sencillamente será la que eligió el modelo.
La anatomía de una frase hablada
Misma pasada · sin coste añadido
Sonido escrito en tres fases · 720P · 15sCuatro capas, nombradas por separado
4
- Diálogo
- Efectos
- Ambiente
- Música
La regla que se le escapa a la gente
No hay campo de prompt negativo. Las exclusiones van dentro del prompt como frases, y el silencio es una de ellas: escribe «sin música» y no tendrás ninguna, no escribas nada y tendrás la que el modelo creyera que merecía la escena.
sin música, sin voz en offBienPrompt negativo: música, voz en offMal
Cualquier cosa con forma de prompt negativo se lee como palabras que renderizar, y la petición se completa igual, así que el fallo llega en forma de clip terminado con las palabras dentro.
¿Partes de una fotografía de quien habla? La sincronización labial pone una casilla de subida delante de la misma convención. ¿Necesitas la misma cara o la misma voz en varios clips? Usa referencia a vídeo: admite hasta diez imágenes, cinco clips y cinco archivos de audio en una sola petición.
Especificaciones de Wan 3.0 de texto a vídeo,
y cuatro trampas
Dos de estas trampas cuestan dinero la primera vez que te las encuentras: si la dejas sin definir, la resolución cae en el nivel caro, y una relación de aspecto ausente hace que la petición falle del todo. El resto son las cifras de Wan 3.0 publicadas por Alibaba, cada una enlazada a su fuente.


- 01Longitud del prompt
- 20 000 caracteresLo que pase de ahí se trunca en silencio en lugar de rechazarse
- Duración
- 2–30 s, segundos enterosUna pasada. Más de treinta significa un segundo clip y un editor
- Fotogramas por segundo
- 30 fps
- 02Resolución
- 480P · 720P · 1080PSin definir cae en 1080P: indícala de forma explícita
- 4K
- No compatible
- Relación de aspecto
- adaptativa, 16:9, 4:3, 1:1, 3:4, 9:16Texto a vídeo necesita una relación concreta: la adaptativa no tiene imagen de la que leerla
- Audio
- Generado en la misma pasadaActivado o desactivado, el precio es idéntico
- Semilla
- 0–2 147 483 647Fija casi toda la variación, no toda
Source: Alibaba Cloud Model Studio · Referencia de Wan 3.0 de texto a vídeo
Las cuatro cosas con las que tropieza la gente
- 01
La resolución cae por defecto en el nivel más caro.
- 480P
- 720P
- 1080P
- unset
Déjala fuera y Wan 3.0 genera, y cobra, en 1080P. Boceta en 480P, que cuesta la cuarta parte por los mismos segundos, y gasta la resolución una sola vez en el que te quedes.
- 02
No hay campo de prompt negativo.
- sin música
- sin texto en pantalla
- sin temblor de cámara
- negative_prompt
Las exclusiones van dentro del prompt como frases. Cualquier cosa con formato de prompt negativo llega como palabras que renderizar, y la petición sigue devolviendo 200, así que pagas por un clip con las palabras dentro.
- 03
La numeración de las referencias distingue mayúsculas.
- Image 1
- Video 1
- Audio 1
- image1
Con mayúscula, con un espacio y numeradas por tipo en el orden de subida. En minúscula y con guiones bajos no se enlazan a nada y el modelo se inventa un sujeto sin decir nada. Más sobre esto en referencia a vídeo.
- 04
La duración inteligente esconde el precio.
- 3s
- 5s
- 15s
- 30s
- auto
Dejar que el modelo elija la duración significa que el coste es desconocido hasta que termina. Nosotros cobramos una duración explícita, así que el número del botón es el número que sale.
Lo que cuesta un clip de Wan 3.0 de texto a vídeo
Los créditos se descuentan cuando vuelve el clip, no cuando pulsas generar. Una ejecución fallida no cuesta nada, se reembolsa automáticamente y sin abrir ninguna incidencia. La duración y la resolución son las dos únicas cosas que mueven la factura: el audio no, la relación de aspecto tampoco, y el plan en el que estés tampoco.
Un clip de 5 segundos, en créditos
- 480P
- 40 créditos
- 720P
- 80 créditos
- 1080P
- 160 créditos
Cada nivel dobla al anterior, y Wan 3.0 mide desde el primer segundo sin ningún suelo gratuito, así que un clip de 15 segundos cuesta el triple que su vecino de 5. El bucle práctico: encuentra el plano en 480P y después ejecuta una sola vez en 1080P el que te quedes. La tabla completa de créditos, y lo que cuesta un clip de treinta segundos.
Los mismos créditos al mes en ambos casos
Wan 3.0 de texto a vídeo en tres pasos
Tres pasos, sin aplicación de edición y sin una segunda pasada para el audio. Llega dentro del mismo archivo que la imagen porque Wan 3.0 los hizo a la vez.
Escribe el plano y el sonido
Un solo campo admite los dos. Usa el constructor de arriba si el problema es la casilla en blanco, y nombra un movimiento de cámara en lugar de recurrir a los adjetivos: el modelo responde al movimiento, no al ambiente.
Hasta 20 000 caracteresFija la duración y la resolución
De dos a treinta segundos enteros. Boceta en 480P: el encuadre que estás probando no necesita más, y es el mismo Wan 3.0 en todos los niveles; la resolución compra píxeles, no un modelo mejor.
2–30 s · 480P / 720P / 1080PDescarga el MP4
El audio ya viene mezclado. Nada que renderizar después, nada que abrir.
Un archivo, con sonido
Alrededor de noventa segundos para un clip corto; treinta segundos en 1080P tarda más. Puedes cerrar la pestaña mientras se ejecuta: el resultado te espera cuando vuelvas, y una ejecución que falla se reembolsa sola.
Preguntas sobre Wan 3.0 de texto a vídeo
Qué lee Wan 3.0 de texto a vídeo en un prompt, qué se inventa allí donde dejas un hueco y qué cuesta una ejecución
¿Qué es Wan 3.0 de texto a vídeo?
¿Tengo que registrarme para probar Wan 3.0 de texto a vídeo?
¿Cuánto puede durar un clip de Wan 3.0 de texto a vídeo?
¿Cuánto puede ocupar un prompt de Wan 3.0?
¿Wan 3.0 de texto a vídeo genera sonido?
¿Hay prompt negativo en Wan 3.0?
¿Cómo escribo el diálogo?
¿Puedo sacar 4K de Wan 3.0 de texto a vídeo?
¿Por qué mi clip ignoró parte del prompt?
¿Qué pasa si la generación falla?
Con una frase basta para averiguarlo.
Tu primer clip corre por nuestra cuenta: el propio Wan 3.0 en 480P, hasta tres segundos, con sonido. ¿No es lo que imaginabas? No te ha costado nada, el constructor sigue abierto una pantalla más arriba, y una ejecución fallida aquí no se cobra nunca.
Escrito y mantenido por el equipo editorial de wan-3.runPublicado el Actualizado el Herramienta versión 2026.09.4
