Wan 3.0 Text zu Video KI
Dreißig Sekunden, Ton inklusive
Ein Prompt hinein, ein fertiger Clip heraus — kein Schnittprogramm dazwischen. Text zu Video KI mit Wan 3.0 läuft 2 bis 30 Sekunden in 480P, 720P oder 1080P und schreibt Dialog, Effekte und Musik in dieselbe Datei wie das Bild. Der erste ist kostenlos, und er läuft auf dem echten Modell statt auf dem vom letzten Jahr.
Sechs Text-zu-Video-Prompts und die Clips, die daraus entstanden sind, danach der Rest der Bibliothek · drück auf Ausprobieren, um einen zu laden
12s · 16:9 · 720PTänzerinnen im Gegenlichtnebel
Was Text zu Video KI dir wirklich gibt
Text zu Video KI mit Wan 3.0 nimmt einen geschriebenen Prompt von bis zu 20.000 Zeichen und gibt eine einzige MP4 von 2 bis 30 Sekunden bei 30 fps zurück, in 480P, 720P oder 1080P, mit Sprache, Geräuschen und Musik aus demselben Durchlauf. Es gibt keinen getrennten Tonschritt und keine Upscaling-Stufe.
Eine Frau geht eine Straße entlang.
Den Rest hat das Modell ergänzt
- Tageszeit?
- was sie trägt?
- woher das Licht kommt?
- wohin die Kamera fährt?
- wie es klingt?
- wie es endet?
Wan 3.0 · 16:9 · 720P · 5sSechs Antworten, die du nicht gegeben hast, für dich entschieden. Das ist kein Unwille des Modells — ein Prompt ist eine Spezifikation, und jede Frage, die er offen lässt, muss Wan 3.0 selbst schließen. Der Platz, sie zu beantworten, macht den ganzen Unterschied: 20.000 Zeichen sind weit mehr, als eine Einstellung je braucht, und das Ton-Briefing steht im selben Feld wie das Bild.
- Zeichen, die du schreiben kannst
- 20,000
- Jede ganze Zahl
- 2–30s
- Auf jeder Stufe
- 30 fps
- Auflösungen: 480P · 720P · 1080P
- 3
- Bild und Ton zusammen
- 1 Durchlauf
Zeichen, die du schreiben kannst
Jede ganze Zahl
Auf jeder Stufe
Auflösungen: 480P · 720P · 1080P
Bild und Ton zusammen
- Kein Ausgangsbild
- Kein getrennter Tonschritt
- Keine Upscaling-Stufe
Fünf Sekunden und dreißig Sekunden sind
verschiedene Wan 3.0-Prompts
Das ist der Fehler, den fast alle zuerst machen. Ein kurzer Wan 3.0-Clip will eine einzige Handlung, genau beschrieben. Ein langer will Beats in Reihenfolge — und wenn du das letzte Drittel unbesetzt lässt, füllt das Modell es mit dem, was ihm gefällt. Unten drei echte Clips, einer pro Länge, jeweils mit dem Prompt, aus dem er entstanden ist.
5 Sekunden
eine Handlung

One subject, one action, one framing. Do not describe a change — there is no room to deliver one.
Hält
Schreib drei Beats in fünf Sekunden und das Modell greift sich den stärksten. Verlang einen, und du bekommst genau den, nach dem du gefragt hast.
12 Sekunden
Beats, in Reihenfolge

Two or three beats with the order stated. Then, after that, finally — connectives are the only scheduling grammar there is.
Löst sich auf
Lang genug, dass eine Form ankommen, stehen und wieder gehen kann. Kurz genug, dass keine Geschichte hineinpasst — und Wan 3.0 kennt keine Timecode-Grammatik, die Reihenfolge muss also aus Worten kommen.
15 Sekunden
Beats, plus ein Ende

Give every beat one job and write the last one down. An unplanned final third is the most common way a long clip goes wrong.
Kommt an
Vier Beats, und den vierten gibt es nur, damit das Modell sich kein eigenes Ende ausdenken muss.
Die Spanne reicht von 2 bis 30 Sekunden, jede ganze Zahl, in einer durchgehenden Einstellung. Ein Entwurf in 480P kostet für dieselben Sekunden ein Viertel von 1080P — finde also die Länge in 480P und gib die Auflösung einmal aus. Wenn die Wartezeit mehr zählt als die Länge, fährt Wan 3.0 Prime dieselbe Spanne auf einer schnelleren Spur. Jeder dieser Prompts steht vollständig in den Prompt-Ideen.
Bau einen Wan 3.0-Prompt nach
Alibabas eigener Formel
Füll die Felder, sieh zu, wie der Prompt sich zusammensetzt, und schick ihn direkt an den Generator.
Alibaba veröffentlicht die Form, die ein Wan-3.0-Prompt haben soll: Entität, dann Szene, dann Bewegung, dann ästhetische Kontrolle, dann Stilisierung, mit dem Ton daneben geschrieben. Das meiste davon geht beim Umformulieren in Fließtext verloren. Diese Felder halten es fest — und keiner der Feldnamen erreicht das Modell, denn Wan 3.0 liest einen einzigen schlichten Absatz und rendert alles, was wie eine Beschriftung aussieht.
Die Reihenfolge zählt
Wohin die Worte gehören
Entität, Szene, Bewegung — was passiert
Wer oder was im Bild ist, wo es ist und was sich bewegt.
- Entität
- Szene
- Bewegung
Schreib es in dieser Reihenfolge, als schlichte Sätze. Beschreib das Motiv konkret genug, um es sich vorzustellen, gib dem Ort eine Tageszeit und eine Lichtquelle, und sag, was sich bewegt, wie weit und wie schnell. Stillstand ist auch eine Antwort — eine Kamera, die du nie erwähnst, darf das Modell bewegen, wie es will.
Ästhetische Kontrolle, Stilisierung — wie es gedreht ist
Einstellungsgröße, Kamerafahrt, Objektiv, Licht — dann ein benannter Look, falls die Einstellung einen braucht.
- Ästhetische Kontrolle
- Stilisierung
Ein Satzteil mit Kommas, der Bildausschnitt, Kamerafahrt mit Größe und Tempo, Objektiv und Licht trägt. Die Stilisierung kommt zuletzt und ist optional: ein Genre bringt eine ganze Grammatik der Auflösung mit sich, drei Worte davon sind so viel wert wie ein Absatz Beschreibung.
Ton — derselbe Durchlauf
Dialog, Effekte, Atmo, Musik — und die Stellen ohne Ton.
- Dialog
- Effekte
- Atmo
- Musik
Wan 3.0 schreibt den Ton neben dem Bild, das hier ist also ein Ton-Briefing und kein Nachgedanke. Benenne die Ebenen einzeln, setz gesprochene Sätze in geschweifte Klammern, und sag, was du nicht hören willst — es gibt kein Feld für negative Prompts, „keine Musik“ ist also ein Satz.
Zusammengesetzter Prompt, live
Entität, Szene, Bewegung
Ein Kurier in durchnässter gelber Jacke drückt nachts mit der Schulter eine Tür in eine enge Gasse auf, Neonlicht läuft über nasse Ziegel.
Ästhetische Kontrolle, Stilisierung
Halbnah, die Kamera fährt langsam heran, eine kleine Bewegung, 35 mm, geringe Schärfentiefe, hartes Licht aus der Szene.
Ton
Regen auf Stoff und Asphalt, ein Türscharnier, entfernter Verkehr. Keine Musik.
0 / 20000
Die Felder sind die Reihenfolge, in der wir komponieren. Die Beschriftungen erreichen das Modell nie.
Was Wan 3.0 damit macht
- 01Ein schlichter String, bis zu 20.000 Zeichen
- 02Keine Feldnamen, keine Einstellungsmarken, keine Timecodes
- 03Dialog wird gesprochen, wenn er {the exact line} ist
- 04Ausschlüsse als Sätze, nicht als negatives Feld
- 05Ton im selben Durchlauf, zum selben Preis
Du willst gar nichts davon schreiben? Der Prompt-Generator baut das Ganze aus einer Zeile, kostenlos und ohne Zähler. Oder fang mit elf Prompts an, aus denen schon Clips geworden sind.
Benenne die Kamerafahrt, und du bekommst das Gefühl
Schreib kinoreif und es passiert nichts — da ist nichts drin, was sich ausführen ließe. Wan 3.0 will eine Bewegung, und es folgt ihr deutlich genauer, wenn die Bewegung eine Größe und ein Tempo mitbringt.
push in / pull out / tracking shot / arc shot / tilt up / pan across / static shot
a small move / a large move
slowly / quickly
Es bewegt sich
slowly push in, a small move
kinoreife Kameraarbeit
Nichts auszuführen
starts with close-ups, then gently circles both playersEine Abfolge, kein Zeitplan. Beginnt mit … dann … ist die ganze Grammatik.
rising slowly from ground level as the machine standsDie Fahrt hängt an der Handlung, also kann sie nicht aus dem Takt laufen.
a slow push in that stops before the centre dancer fills the frameEine Fahrt mit einer Endbedingung statt mit einer Zeit. Robuster als beides.
Wo die Bewegung stattfindet
Jenseits der Dauer, die du gesetzt hast — das Modell staucht, statt zu verlängern
Hier endet die Dauer, die du gesetzt hast
Wan 3.0 kennt keine Timecode-Grammatik. Die Reihenfolge kommt aus Bindewörtern — dann, danach, zuletzt — und am zuverlässigsten planst du eine Kamerafahrt, indem du sie an eine Handlung hängst statt an einen Zeitpunkt: eine Fahrt, die an einer Handlung hängt, staucht sich mit ihr, statt aus dem Takt zu laufen.
Du hast schon Material, das du lieber umstilisieren als neu schreiben würdest? Das ist die Wan 3.0 Videobearbeitung. Du brauchst dasselbe Motiv über mehrere Clips? Referenz zu Video.
Dialog und Ton in einen
Wan 3.0-Prompt schreiben
Wan 3.0 generiert den Ton neben dem Bild in derselben Anfrage, das Prompt-Feld ist also zugleich das Ton-Briefing — und es kostet exakt dasselbe, ob du es schreibst oder nicht. Sag nichts, und du bekommst trotzdem eine Tonspur; nur eben eine, die das Modell ausgesucht hat.
Anatomie eines gesprochenen Satzes
Derselbe Durchlauf · kein Aufpreis
Ton in drei Stufen geschrieben · 720P · 15sVier Ebenen, einzeln benannt
4
- Dialog
- Effekte
- Atmo
- Musik
Die Regel, die alle übersehen
Es gibt kein Feld für negative Prompts. Ausschlüsse gehören als Sätze in den Prompt, und Stille ist einer davon — schreib „keine Musik“ und du bekommst keine, schreib nichts und du bekommst das, was das Modell für passend hielt.
keine Musik, kein Voice-overRichtigNegativer Prompt: Musik, Voice-overFalsch
Alles, was wie ein negativer Prompt aussieht, wird als zu rendernde Worte gelesen, und die Anfrage läuft trotzdem durch — der Fehler kommt also als fertiger Clip zurück, mit den Worten darin.
Du fängst mit einem Foto der sprechenden Person an? Lippensynchronisation stellt ein Upload-Feld vor dieselbe Konvention. Du brauchst dasselbe Gesicht oder dieselbe Stimme über mehrere Clips? Nimm Referenz zu Video — es trägt bis zu zehn Bilder, fünf Clips und fünf Audiodateien in einer Anfrage.
Text zu Video KI — die Werte,
und vier Fallen
Zwei dieser Fallen kosten beim ersten Mal Geld: bleibt die Auflösung leer, läuft alles auf der teuren Stufe, und ein fehlendes Seitenverhältnis lässt die Anfrage direkt scheitern. Der Rest sind Alibabas veröffentlichte Wan-3.0-Zahlen, jede mit ihrer Quelle verlinkt.


- 01Prompt-Länge
- 20.000 ZeichenLängere Eingaben werden stillschweigend gekürzt statt abgelehnt
- Dauer
- 2–30 s, ganze SekundenEin Durchlauf. Über dreißig hinaus heißt: zweiter Clip und ein Schnittprogramm
- Bildrate
- 30 fps
- 02Auflösung
- 480P · 720P · 1080PBleibt sie leer, wird 1080P genommen — setz sie ausdrücklich
- 4K
- Nicht unterstützt
- Seitenverhältnis
- adaptive, 16:9, 4:3, 1:1, 3:4, 9:16Text zu Video braucht ein konkretes Verhältnis — adaptive hat kein Bild, von dem es eins ablesen könnte
- Ton
- Im selben Durchlauf generiertAn oder aus, der Preis bleibt gleich
- Seed
- 0–2.147.483.647Fixiert den größten Teil der Streuung, nicht alles
Source: Alibaba Cloud Model Studio · Referenz zu Wan 3.0 Text-zu-Video
Die vier Dinge, über die alle stolpern
- 01
Die Auflösung fällt auf die teuerste Stufe zurück.
- 480P
- 720P
- 1080P
- unset
Lass sie weg, und Wan 3.0 generiert in 1080P — und rechnet auch so ab. Entwirf in 480P, das für dieselben Sekunden ein Viertel kostet, und gib die Auflösung einmal für den Clip aus, den du behältst.
- 02
Es gibt kein Feld für negative Prompts.
- keine Musik
- kein Text im Bild
- kein Wackeln der Kamera
- negative_prompt
Ausschlüsse gehören als Sätze in den Prompt. Alles, was als negativer Prompt formatiert ist, kommt als zu rendernde Worte an, und die Anfrage gibt trotzdem 200 zurück — du bezahlst also einen Clip mit den Worten darin.
- 03
Die Nummerierung von Referenzen ist Groß- und Kleinschreibung-empfindlich.
- Image 1
- Video 1
- Audio 1
- image1
Großgeschrieben, mit Leerzeichen, je Typ in der Reihenfolge des Uploads nummeriert. Kleinbuchstaben und Unterstriche binden an nichts, und das Modell denkt sich stillschweigend ein eigenes Motiv aus. Mehr dazu bei Referenz zu Video.
- 04
Die automatische Dauer verbirgt den Preis.
- 3s
- 5s
- 15s
- 30s
- auto
Wenn das Modell die Länge wählt, steht der Preis erst fest, wenn es fertig ist. Wir rechnen stattdessen eine ausdrückliche Dauer ab, damit die Zahl auf dem Button die Zahl ist, die abgebucht wird.
Was ein Clip aus Text zu Video KI kostet
Credits gehen ab, wenn der Clip zurückkommt, nicht wenn du auf Generieren drückst. Ein fehlgeschlagener Durchlauf kostet nichts und wird automatisch erstattet, ohne Ticket. Nur Länge und Auflösung bewegen die Rechnung — der Ton nicht, das Seitenverhältnis nicht, und der Tarif, in dem du bist, auch nicht.
Ein Clip von 5 Sekunden, in Credits
- 480P
- 40 Credits
- 720P
- 80 Credits
- 1080P
- 160 Credits
Jede Stufe verdoppelt, und Wan 3.0 rechnet ab der ersten Sekunde ohne Freibetrag ab — ein Clip von 15 Sekunden kostet also das Dreifache seines Nachbarn mit 5. Die praktische Schleife: finde die Einstellung in 480P, dann lass den Clip, den du behältst, einmal in 1080P laufen. Die vollständige Credit-Tabelle und was ein Clip von dreißig Sekunden kostet.
So oder so dieselben Credits pro Monat
Text zu Video KI in drei Schritten
Drei Schritte, kein Schnittprogramm, kein zweiter Durchlauf für den Ton. Er kommt in derselben Datei wie das Bild an, weil Wan 3.0 beides zusammen gemacht hat.
Schreib das Bild und den Ton
Ein Feld nimmt beides. Nimm den Baukasten weiter oben, wenn das leere Feld das Problem ist, und benenne eine Kamerafahrt, statt zu Adjektiven zu greifen — das Modell reagiert auf die Bewegung, nicht auf die Stimmung.
Bis zu 20.000 ZeichenLänge und Auflösung setzen
Zwei bis dreißig ganze Sekunden. Entwirf in 480P: der Bildausschnitt, den du testest, braucht nicht mehr, und es ist auf jeder Stufe dasselbe Wan 3.0 — die Auflösung kauft Pixel, kein besseres Modell.
2–30s · 480P / 720P / 1080PMP4 herunterladen
Der Ton ist schon eingemischt. Nichts mehr zu rendern, nichts mehr zu öffnen.
Eine Datei, Ton inklusive
Etwa neunzig Sekunden für einen kurzen Clip; dreißig Sekunden in 1080P dauern länger. Du kannst den Tab schließen, während es läuft — das Ergebnis wartet, wenn du zurückkommst, und ein fehlgeschlagener Durchlauf erstattet sich selbst.
Fragen zu Text zu Video KI
Was Text zu Video KI aus einem Prompt liest, was es sich dort ausdenkt, wo du eine Lücke lässt, und was ein Durchlauf kostet
Was ist Text zu Video KI mit Wan 3.0?
Muss ich mich registrieren, um Text zu Video KI zu testen?
Wie lang darf ein Clip aus Text zu Video KI sein?
Wie lang darf ein Wan-3.0-Prompt sein?
Generiert Text zu Video KI auch Ton?
Gibt es in Wan 3.0 einen negativen Prompt?
Wie schreibe ich Dialog?
Bekomme ich aus Text zu Video KI auch 4K?
Warum hat mein Clip einen Teil des Prompts ignoriert?
Was passiert, wenn die Generierung fehlschlägt?
Ein Satz reicht, um es herauszufinden.
Dein erster Clip geht auf uns — Wan 3.0 selbst in 480P, bis zu drei Sekunden, mit Ton. Nicht das, was du dir vorgestellt hast? Gekostet hat es dich nichts, der Baukasten ist einen Bildschirm weiter oben noch offen, und ein fehlgeschlagener Durchlauf wird hier nie berechnet.
Geschrieben und gepflegt von der Redaktion von wan-3.runVeröffentlicht am Zuletzt aktualisiert am Tool Version 2026.09.4
