Wan 3.0 Bild zu Video
Leg ein Foto hinein, und es bewegt sich. Füg ein zweites Bild dazu, und Bild-zu-Video-KI mit Wan 3.0 reist vom ersten Frame zum letzten. Zwei bis dreißig Sekunden, Ton in derselben Datei, und dein erster Clip ist kostenlos — eine E-Mail, keine Karte.
Zwei veröffentlichte Wan-3.0-Beispiele, dann jede weitere Idee der Website · „Ausprobieren“ lädt den Prompt und seinen Frame
STARTFRAME · 16:9 · 720PEin Standbild mit vier kleinen Änderungen wecken
Was Bild-zu-Video-KI mit Wan 3.0
aus deinem Foto macht
Dein Foto wird der tatsächlich erste Frame — keine Stilreferenz, sondern buchstäblich der Anfang der Einstellung.

Frame 001 · deiner
Generiert aus dem, was du beschrieben hast
Bild-zu-Video-KI mit Wan 3.0 nimmt ein Bild als Anfangsframe und generiert daraus 2 bis 30 Sekunden Bewegung, bei 30 fps in 480P, 720P oder 1080P, mit Ton aus demselben Durchlauf. Gib ein zweites Bild dazu, und es wird zum Schlussframe, während das Modell den Weg dazwischen auffüllt.
- Dein Foto ist Frame eins
- 001
- Jede ganze Sekunde
- 2–30 s
- Bildrate
- 30 fps
- Auflösung
- 480P / 720P / 1080P
Dein Foto ist Frame eins
Jede ganze Sekunde
Bildrate
Auflösung
- Kein HEIC — der Standardcontainer eines iPhones steht nicht auf der Liste
- Keine Transparenz — ein PNG-Alphakanal wird abgelehnt, nicht zusammengerechnet
- Kein Referenzbild neben einem ersten Frame — die beiden Familien schließen sich aus
Erster Frame, letzter Frame
oder beide
Bild-zu-Video-KI mit Wan 3.0 ist ein Endpunkt mit zwei Wegen hinein. Den falschen zu wählen ist der häufigste Grund, warum sich ein Ergebnis daneben anfühlt — hier steht also, wann welcher die richtige Antwort ist und warum der andere es nicht ist.
Nur erster Frame
first_frame
Ein Foto als erster Frame. Dein Video öffnet mit deinem Bild und bewegt sich von dort nach vorn. Nimm das, wenn du die Anfangseinstellung hast und sehen willst, was Wan 3.0 daraus als Nächstes macht.
So schreibst du es
Beschreib, was als Nächstes passiert, nicht was schon im Bild ist — Wan 3.0 sieht das Bild bereits. Text zu Video kann nicht garantieren, dass die Ausgabe deinem Foto überhaupt ähnelt, und genau deshalb bist du hier.
Erster + letzter Frame
first_frame + last_frame

Zwei Fotos, ein Anfang und ein Ende. Wan 3.0 füllt den Weg dazwischen. Nimm das, wenn du genau weißt, wo die Einstellung beginnt und wo sie landen muss — eine Produktdrehung, ein Vorher-Nachher, ein Szenenwechsel.
So schreibst du es
Mit nur einem ersten Frame entscheidet Wan 3.0 über das Ziel, und dein Ende wird es nicht erraten. Sind die beiden Bilder sehr verschieden, schreib in klaren Worten, was dazwischen passiert, sonst erfindet es einen Übergang.
Eine harte Regel: Die Frame-Familie und die Referenzfamilie lassen sich nicht mischen. Schick einen ersten Frame und ein Referenzbild in derselben Anfrage, und Wan 3.0 lehnt sie ab, statt eines auszuwählen — einen Charakter über mehrere Einstellungen zu tragen, ist Referenz zu Video. Gar kein Ausgangsbild? Fang mit Worten an. Mehr ausgearbeitete Aufbauten in den Prompt-Ideen. Und wenn der Bildausschnitt selbst sich nicht bewegen darf — ein Screen, ein Raum, eine Zahlentabelle — ist das eine eigene Art von Aufnahme.
Eine Bilddatei,
oder die Seite, auf der sie liegt
Bild zu Video braucht eine Datei. Wenn du stattdessen einen Link hast — eine Produktseite, ein Datenblatt, einen Beitrag — gibt es auf dieser Website eine zweite Tür, und sie macht eine andere Arbeit statt derselben.
Bild zu Video nimmt das Foto selbst. Deine Aufnahme wird zum ersten Frame und das Modell geht von dort weiter, das Motiv im Clip ist also das Motiv, das du hochgeladen hast. URL zu Video fasst das Bild nie an. Es liest, was die Seite sagt, und generiert daraus neues Material; nichts von der Seite taucht im Ergebnis auf. Nimm das erste, wenn das Ding wie dein Ding aussehen muss; nimm das zweite, wenn du eine Seite hast und kein Shooting.
01
Du hast eine Datei
Leg sie in das Feld ganz oben. Die Prüfung auf dieser Seite nennt die Grenze, an der es gescheitert wäre, bevor ein Credit ausgegeben ist.
02
Du hast einen Link
URL zu Video nimmt eine öffentliche Adresse und liest die Seite dahinter. Auch diese Prüfung ist kostenlos und braucht kein Konto.
03
Du hast keines von beidem
Text zu Video startet allein aus einem geschriebenen Prompt, mit denselben dreißig Sekunden und demselben Ton aus demselben Durchlauf.
Stattdessen mit einer Seite anfangen
URL zu Video ist der Weg über den Link und Text zu Video der Weg über den Prompt. Alle drei fahren dasselbe wan3.0-video zum selben Sekundenpreis.
Ein Link, der sich in deinem Browser öffnet, ist nicht automatisch ein Link, den das Modell holen kann: Die Generierung läuft in einem anderen Netz. Die Linkprüfung nennt die Hosts, deren Absage aus diesem Netz gemessen wurde.
Prüf dein Bild,
bevor du einen Credit ausgibst
Der ärgerlichste Weg, eine Generierung zu verlieren, ist, hinterher zu merken, dass die Datei nie funktionieren konnte. Leg hier ein Bild ab, und es wird gegen die tatsächlichen Grenzen von Wan 3.0 geprüft — Format, Größe, Maße, Verhältnis und Transparenz — mit der Lösung neben der Zeile, die durchfällt. Nichts wird hochgeladen: Die Prüfung läuft in deinem Browser.
JPG · JPEG · PNG · BMP · WEBP · ≤20.0 MB · 240–8,000px · ratio ≤8:1
Lass sie so oft laufen, wie du willst — vor jedem Batch, wenn es hilft. Die Prüfung rührt das Modell nie an, Bild-zu-Video-KI mit Wan 3.0 berechnet dir also nie eine Datei, die ohnehin nicht funktioniert hätte.
Bildgrenzen von Wan 3.0
— und welche Zahlen die alten sind
Such nach einer Bildgrößengrenze für Wan, und du findest mehrere verschiedene Antworten, alle von Alibaba, alle richtig — für ein anderes Modell. Hier steht die Wan-3.0-Spalte, und das Uploadfeld oben auf dieser Seite prüft jede Zeile, bevor du etwas ausgibst.
iPhone-Fotos gehen nicht direkt hinein. HEIC ist der iPhone-Standard, und Wan 3.0 kann den Container nicht lesen — die Prüfung merkt es in einer Sekunde und nennt die Einstellung, die du ändern musst.
- Seitenverhältnis
- ≤ 8:1In beide Richtungen — eine 1:8-Spalte wird abgelehnt wie ein 8:1-Banner
- Offiziell
Alibaba lässt die ältere Dokumentation zu Bild zu Video veröffentlicht und indexiert, und sie rankt gut, weil sie länger da ist. Beide Seiten stimmen; nur eine davon handelt von Wan 3.0. Das Erkennungszeichen ist die Modell-ID — steht irgendwo auf der Seite wan2.1, wan2.2 oder kf2v, sind ihre Zahlen nicht die, die dieser Generator benutzt: Diese Dokumentation nennt 800 Prompt-Zeichen, 360–2.000 px, 10 MB und feste fünf Sekunden, gegenüber den 20.000 Zeichen, 240–8.000 px, 20 MB und jeder ganzen Sekundenzahl von 2 bis 30 bei Wan 3.0.
Verändert es mein Gesicht?
So driftet das Motiv nicht weg
Drift heißt: Das Gesicht in Sekunde acht ist nicht ganz das Gesicht aus Sekunde eins — dasselbe Foto, zweimal gelaufen.
Wan 3.0 hält einen Anfangsframe gut und hält ihn umso schlechter, je länger der Clip läuft und je mehr sich die Kamera bewegt. Beschreibt dein Prompt nur Bewegung, bleibt alles offen, was du nicht beschrieben hast, und das Modell darf es neu erfinden.
Drei Dinge helfen, in der Reihenfolge ihrer Wirkung. Gib der Bewegung ein Ziel — „dreht sich zum Fenster“ hält besser als „bewegt sich herum“. Halt die Kamera ehrlich: eine benannte Bewegung pro Clip, denn Wan 3.0 verfolgt ein Motiv durch eine Zoomfahrt weit zuverlässiger als durch ein unbestimmtes Handkamera-Wandern. Und kürz lieber, statt dagegen anzukämpfen — aus einem Clip von zwanzig Sekunden mit Drift werden oft zwei saubere von zehn Sekunden, günstiger zu generieren und leichter zu schneiden.

Der Mantel wechselt die Webart und der Haaransatz wandert. Nichts im Prompt sagte, dass sie es nicht sollen.

Gleiche Kamerabewegung, gleiche Länge, gleiche Seed-Bedingungen. Der Satz ist der einzige Unterschied.
Der einzige Unterschied zwischen ihnen
The subject — roter Wollmantel, dunkler Pony, silberner Ring an der linken Hand — keeps the same face, hair, clothing and colours throughout; only the camera and the described motion change.
Tipp ein, was sich nicht ändern darf — eine Farbe, ein Logo, ein Gesicht. Je konkreter das Substantiv, desto weniger deutet Wan 3.0 es um. ⚠️ **Der Rahmensatz bleibt englisch, deine Merkmale stehen auf Deutsch dazwischen** — Wan 3.0 garantiert nur Englisch und Chinesisch, und genau so machen es hier die Konten mit Markenarbeit.
Kommt ans Ende deines Prompts
The subject keeps the same face, hair, clothing and colours throughout; only the camera and the described motion change.
Die lange Fassung davon — woher Drift kommt, was der Satz hält und was nicht — steht unter Konsistente Charaktere. Muss das Motiv mehrere getrennte Einstellungen überstehen statt einer langen, ist das ein anderer Modus: Referenz zu Video nimmt bis zu zehn Bilder desselben Charakters und hält sie über Generierungen hinweg. Es lässt sich nicht mit einem ersten Frame in derselben Anfrage kombinieren. Einen Screen zu verriegeln statt eines Gesichts ist dieselbe Anweisung eine Nummer größer.
Warum Wan 3.0 das Seitenverhältnis
aus deinem Bild nimmt
Lass das Verhältnis auf adaptive, und die Ausgabe folgt deinem Ausgangsbild, was fast immer das ist, was du willst — aus einem Hochformatfoto wird ein Hochformatclip, ohne Beschnitt und ohne Ränder. Das ist das Gegenteil von Text zu Video, wo es kein Bild zum Ablesen gibt und du wählen musst. Wan 3.0 unterstützt adaptive sowie 16:9, 4:3, 1:1, 3:4 und 9:16.
Bild zu Video · diese Seite
ratio: adaptive
Aus dem Bild gelesen, das du hochgeladen hast. Änderbar, aber es weiß es schon.
Text zu Video
ratio: Pflicht
Adaptive wird rundheraus abgelehnt — es gibt kein Bild, aus dem sich ein Format ableiten ließe.
Setz ein ausdrückliches Verhältnis nur, wenn das Ziel es verlangt und du bereit bist, Ränder zu verlieren — ein 4:3-Foto auf adaptive gibt ein 4:3-Video, das im Handy-Feed als Balken mit schwarzen Rändern sitzt. In Wan 3.0 gibt es kein 21:9: Für einen breiten Kinobalken generierst du in 16:9 und beschneidest im Schnittprogramm, statt nach einer Einstellung zu suchen, die es nicht gibt.
Den Übergang schreiben,
nicht das Bild
Das ist der Teil, den Leute im Modus mit erstem und letztem Frame falsch machen. Wan 3.0 sieht beide Bilder bereits — es braucht von dir keine Beschreibung dessen, was darin ist. Was es braucht, ist, was dazwischen passiert.
Describing the picture
Describing the change
Ein junges Mädchen lächelt in einem warmen Raum
Ein junges Mädchen geht allmählich vom Lächeln ins Lachen über, die Kamera fährt langsam näher, das Hintergrundlicht wechselt von kühlen zu warmen Tönen.
Eine geschlossene Produktschachtel auf einem Schreibtisch
Der Deckel hebt sich über vier Sekunden ab, die Kamera geht in eine Untersicht, während der Inhalt sichtbar wird, ein weiches Klicken beim Öffnen.
Das erste Paar ist Alibabas eigener Beispiel-Prompt für den Modus mit erstem und letztem Frame — zweimal lesen lohnt sich, denn er benennt drei getrennte Dinge, die sich ändern: den Ausdruck, die Kamera und das Licht.
Dasselbe Prinzip bei jeder Länge: Benenn die Veränderung, benenn die Kamera, benenn den Ton. Beschreibt nichts im Prompt eine Bewegung, erfindet Wan 3.0 eine. Du willst die Formulierung fertig gebaut? Der Prompt-Baukasten. Die strengste Fassung davon ist ein Bildausschnitt, der sich überhaupt nicht bewegen darf.
Wenn das, was sich nicht ändern darf,
das ganze Bild ausfüllt
Ein Gesicht darf driften, die Aufnahme funktioniert trotzdem. Ein Dashboard nicht. Wenn das Bild, das du animierst, das Produkt selbst ist — ein Screen, ein Raum, eine Zahlentabelle — trägt jedes Pixel etwas, und der Satz, der es festhält, muss das Erste im Prompt sein und kein Nachtrag am Ende.
Es ist dieselbe Mechanik wie bei erstem und letztem Frame weiter oben, nur auf einen härteren Fall gerichtet: Bild-zu-Video-KI soll eine Zone verändern und alles drumherum exakt dort lassen, wo es war.
Die Zahlen laufen hoch, die Oberfläche bleibt stehen
Eine Umsatzzahl, die von 100.00 auf 30,197.00 hochzählt, während Seitenleiste, Diagrammachsen und Spaltenköpfe festgenagelt bleiben. Das ist die Dashboard-Animation, die Leute mit einer Bildschirmaufnahme einer Tabelle nachzustellen versuchen — und die meistens scheitert, weil in der Aufnahme der Mauszeiger zu sehen ist.
Du lieferst
Denselben Screen zweimal — einmal mit der kleinen Zahl, einmal mit der großen.
Ein Screen, den es noch gar nicht gibt
Das App-Demo-Video, das du brauchst, bevor der Build fertig ist oder bevor du ein Gerät zum Aufnehmen hast. Ein Mockup-Video ist ein Standbild und ein Endpunkt — ein offenes Menü, ein gefülltes Panel, ein umgelegter Schalter — und die Kamera bewegt sich nie.
Du lieferst
Zwei exportierte Frames aus deiner Designdatei. Kein Prototyp, kein Plugin, keine Aufnahme.
Der Raum bleibt, die Einrichtung kommt
Von leerem Raum zu möbliertem Raum, von nackter Wand zu fertiger Wand. Die Architektur ist das, was sich nicht bewegen darf; alles andere darf es.
Du lieferst
Das Vorher- und das Nachher-Foto, aus derselben Position aufgenommen.
Der Satz, der die Arbeit macht
Drei Leute ohne Verbindung zueinander sind bei fast demselben Satz gelandet, was meistens heißt, dass dieser Satz dem Modell etwas gibt, das es braucht. Kopier das hier, ersetz die beiden Zeilen in eckigen Klammern und lass den Rest stehen:
Use image 1 as the starting frame and image 2 as the ending frame. The animation must begin exactly with image 1 and end exactly with image 2. Lock the entire frame in place: same layout, same crop, same camera. No pan, no tilt, no zoom, no perspective change, no re-rendering of the surrounding elements. The only thing that changes is [WHAT MOVES]. [HOW IT MOVES — e.g. the figures count upward smoothly through many intermediate values until they reach the final number.]
Warum diese Reihenfolge: Das Modell gewichtet den Anfang eines Prompts stärker als das Ende, also muss die Verriegelung vor die Beschreibung der Veränderung. Schreibst du Lock the entire frame in den letzten Absatz, liest es sich wie ein Wunsch. Steht es an zweiter Stelle, liest es sich wie eine Bedingung.
Drei Arten zu driften — und die Zeile, die jede davon stoppt
Die Kamera fährt langsam hinein, obwohl du das nie verlangt hast
Bewegung ist die Voreinstellung. Ohne Anweisung liefert das Modell welche.
The camera is locked off. No push-in, no drift, no handheld motion.
Das Layout stimmt, aber der Kleintext ist jetzt ein anderer Kleintext
Schrift wird neu gezeichnet, nicht kopiert.
Do not redraw text. Keep every label, header and axis exactly as supplied.
Es schneidet zwischen deinen beiden Frames, statt sich dazwischen zu bewegen
Zwei Endpunkte ohne etwas dazwischen lesen sich als Schnitt.
One continuous shot. Interpolate every intermediate state; no cut, no fade, no dissolve.
Was es hält und was nicht
Es hält Layout und Position. Es garantiert keine Glyphen und Zeichen: Eine Zahl kann als andere Zahl zurückkommen, und Beschriftungen in Sechs-Punkt können als Sechs-Punkt-Formen zurückkommen, die nur aussehen wie Beschriftungen.
Das zu prüfen kostet zehn Sekunden und lohnt sich jedes Mal. Spring auf den letzten Frame, sieh ihn dir bei 100 % an und lies die eine Zahl, wegen der es den Clip gibt. Hat sie den letzten Frame überstanden, hat sie das ganze Hochzählen überstanden; wenn nicht, lass dieselben zwei Bilder noch einmal laufen und schreib die Zahl ausgeschrieben in den Prompt.
Diese Grenze ist die ganze Grundlage für die Wahl zwischen zwei Arten von Werkzeug. Müssen deine Screenshots Byte für Byte überleben, willst du einen Zusammensetzer, der über die vorhandenen Bilder schwenkt und zoomt. Brauchst du ein Bild, das nie aufgenommen wurde — eine Zahl mitten im Hochzählen, ein halb geöffnetes Panel, ein halb möblierter Raum — dann muss es generiert werden, und genau das ist das hier.
Dieselben zwei Felder wie beim Modus mit erstem und letztem Frame; hier ändert sich nur, was du dazwischen schreibst.
Was ein Clip mit Bild-zu-Video-KI kostet
Gleich wie bei Text zu Video: Länge und Auflösung setzen den Preis, der Ton nicht, und ein zweiter Frame kostet nichts extra. Ein fehlgeschlagener Durchlauf wird automatisch erstattet — und mit der Prüfung oben erreichen die meisten Fehlschläge, die früher Credits kosteten, das Modell gar nicht erst.
So wird abgerechnet
- Abgerechnet nach
- Ausgabesekunde
- Fehlgeschlagene Generierung
- erstattet
- Dein erster Clip
- kostenlos · 480P
Entwirf in 480P, bis die Bewegung sitzt, und lass den Keeper einmal in 720P oder 1080P laufen — das Bild muss zwischen den Durchläufen nicht neu geprüft werden. Beim Keeper verdient sich auch Wan 3.0 Prime seinen glatten Faktor 1,5: dieselbe Spezifikation, weniger Warten. Alle Preise.
So oder so dieselben Credits pro Monat
Ein Standbild animieren
mit Bild-zu-Video-KI
Der Schritt, der über das Ergebnis entscheidet, ist der dritte: Beschreib, was sich zwischen den Frames ändert, die du festgelegt hast — nicht, was darin ist.
Leg deinen ersten Frame hinein
Die Prüfung läuft sofort, in deinem Browser. Eine gute Datei zeigt eine grüne Zeile; eine schlechte gibt dir die Lösung, bevor du etwas ausgibst.
Kostenlos geprüftFüg einen letzten Frame dazu, wenn du das Ende kennst
Ein Bild reicht — Wan 3.0 entscheidet dann, wohin die Einstellung geht. Gib ein zweites dazu, und es wird stattdessen zum Schlussframe.
OptionalSag, was sich ändert, nicht was da ist
Wan 3.0 sieht die Bilder bereits. Beschreib die Bewegung dazwischen, die Kamera und den Ton.
Ton im selben FeldLänge und Auflösung setzen, dann generieren
Jede ganze Sekundenzahl von 2 bis 30, bei 30 fps in 480P, 720P oder 1080P, zurück als eine MP4 mit dem Ton darin.
Bis zu 1080P
Rund neunzig Sekunden für einen kurzen Clip, und du kannst den Tab schließen, während er läuft. Das hochgeladene Foto wird nie verändert — die Ausgabe ist eine neue Datei.
Häufig gestellte Fragen zu Bild-zu-Video-KI
Was Bild zu Video mit Wan 3.0 aus deinem Standbild behält, was es bewegen darf und was ein Durchlauf kostet
Muss ich mich registrieren, um ein Foto zu animieren?
Welche Bildformate nimmt Wan 3.0 an?
Warum lädt mein iPhone-Foto nicht hoch?
Wie groß darf das Bild sein?
Brauche ich einen letzten Frame?
Kann ich ein Referenzbild und einen ersten Frame zusammen benutzen?
Wie lang darf ein Clip aus Bild zu Video sein?
Behält das Video das Seitenverhältnis meines Bildes?
Generiert Bild zu Video mit Wan 3.0 auch Ton?
Was passiert, wenn die Generierung fehlschlägt?
Kann Wan 3.0 einen Screenshot in ein Video verwandeln?
Wie mache ich ein App-Demo-Video, ohne meinen Bildschirm aufzunehmen?
Warum driftet meine Dashboard-Animation weiter, obwohl ich sie stillstehen lassen wollte?
Bring ein Foto mit, nimm einen Clip mit
Leg ein Bild hinein, lass es von der Prüfung bestätigen und generier. Ein kostenloser Wan 3.0-Clip in 480P, bis zu drei Sekunden — eine E-Mail, keine Karte. Ist die Bewegung nicht die, die du dir vorgestellt hast, hat sie dich nichts gekostet.
Geschrieben und gepflegt von der Redaktion von wan-3.runVeröffentlicht am Zuletzt aktualisiert am Tool Version 2026.09.4
