Wan 3.0 Referenz zu Video
Lade das Gesicht hoch, die Jacke, das Produkt, die Stimme — Wan 3.0 nimmt alle vier und hält jede einzelne bis zu dreißig Sekunden lang gleich, in einer Szene, die es nie gab. Bis zu zehn Bilder, fünf Clips und fünf Tonspuren in einer Generierung.
Drei veröffentlichte Wan-3.0-Durchläufe, dann jede weitere Idee der Website · „Ausprobieren“ lädt den Prompt
16:9 · 720P · 5 sZitiert Image 1 und hält es fest
Was Referenz zu Video mit Wan 3.0
gleich hält
Du lädst Material hoch, und Wan 3.0 baut eine Szene, die ihm gehorcht.
Referenzbild-zu-Video-KI mit Wan 3.0 nimmt bis zu zwanzig Referenzdateien — zehn Bilder, fünf Videoclips und fünf Tonspuren — und behandelt jede als Vorgabe statt als Ausgangspunkt. Diese Gesichter, Kleidungsstücke, Requisiten, Stimmen und räumlichen Beziehungen bleiben über eine einzelne Einstellung von bis zu dreißig Sekunden konstant, mit Ton aus demselben Durchlauf.
- Bilder · Clips · Tonspuren
- 10 + 5 + 5
- Dateien in einer Anfrage
- 20
- Jede ganze Sekunde
- 2–30 s
- 30 fps, Ton inklusive
- 480P / 720P / 1080P
Bilder · Clips · Tonspuren
Dateien in einer Anfrage
Jede ganze Sekunde
30 fps, Ton inklusive
- Kein Schnittprogramm — es baut eine neue Szene, statt eine alte zu ändern
- Kein Face-Swap und kein Weg, jemanden ohne Einwilligung in ein Video zu setzen
- Kein erster Frame neben Referenzen — diese beiden Familien schließen sich aus
Warum Wan 3.0 Referenzen und einen ersten Frame nicht zusammen nimmt
Wan 3.0 hat zwei Familien von Medieneingaben, und eine einzelne Anfrage darf nur eine davon benutzen.
reference_imageReferenzfamilieDiese Seitereference_image·reference_video·reference_audio·file·link— Material, von dem sich das Modell borgt, um eine Szene zu bauen, die es nie gab.
first_frameFrame-FamilieBild zu Videofirst_frame·last_frame— ein exakter Anfang und optional ein exaktes Ende, durch die die Ausgabe hindurchgehen muss.
Schick je eine aus beiden Familien, und Wan 3.0 lehnt die Anfrage rundheraus ab, statt einen Sieger zu küren — deshalb sperrt diese Seite die Frame-Eingaben in dem Moment, in dem du eine Referenz hinzufügst. Die Ablehnung passiert bei Alibaba, nachdem du dich angestellt hast, sie hier abzufangen kostet also eine Sekunde statt eines Platzes in der Warteschlange.
Welche Familie du willst, folgt aus der Frage, die du stellst. „Beginn genau auf diesem Foto“ ist ein Frame, und das ist Bild zu Video. „Behalt dieses Gesicht, aber an einem Ort, an dem es nie war“ ist eine Referenz, und das ist diese Seite. Driftet das Motiv innerhalb eines einzelnen Clips statt zwischen Einstellungen, ist das Referenzset nicht die Lösung — Konsistente Charaktere ist es.
Wie viele Referenzen
Wan 3.0 annimmt
Drei Arten von Material gehen in Wan 3.0, jede mit eigener Obergrenze: zehn Bilder, fünf Videoclips, fünf Tonspuren.
⚠️ Wan 3.0 rechnet die Sekunden eines Referenz-Clips zusammen mit deinen Ausgabesekunden ab, und beide zusammen dürfen dreißig nicht überschreiten. Sechs Sekunden Referenz plus zwanzig Sekunden Ausgabe sind sechsundzwanzig abgerechnete Sekunden und eine gültige Anfrage; sechs plus achtundzwanzig nicht. Bilder, Ton, Dokumente und Links kommen nicht dazu.
- Referenzbilder
- ≤ 10 · je ≤ 20 MB · JPEG · JPG · PNG (ohne Alpha) · BMP · WEBP240–8.000 px pro Seite, Seitenverhältnis bis 8:1
- Offiziell
- Alles zusammen
- 20, und das sind diese drei addiertAlibaba setzt eine Grenze pro Art. Für die Summe gibt es keine eigene Obergrenze — diese Zeile ist Rechnung, keine veröffentlichte Zahl.
- Offiziell
Fünf Videoplätze zu je fünfzehn Sekunden wären fünfundsiebzig Sekunden, und die Obergrenze liegt bei fünfzehn — beim Video ist also nie die Zahl der Plätze die bindende Grenze, sondern die laufende Summe. Der Zähler über dem Prompt-Feld verfolgt beides, in Sekunden und in Credits, bevor du auf Generieren drückst.
Was Wan 3.0 wirklich stabil hält
Alibaba nennt vier Dimensionen der Wan-3.0-Konsistenz. Es lohnt sich, sie getrennt zu kennen, denn wenn etwas driftet, ist es meist eine davon und nicht alle vier.
Das Motiv
Worauf die Kamera zeigt.
charactersCharaktere
Gesichtszüge, Frisur und Haarfarbe, Körperform, Kleidung, Accessoires.
Fein genug, dass die Riemen einer Jacke eine Kampfszene überstehen.
propsRequisiten
Aussehen aus mehreren Winkeln, Aufbau der Beschläge, Logos, Materialdetails.
Dieselbe Flasche, Einstellung für Einstellung, Etikett intakt.
Die Szene
Alles rund um das Motiv.
spaceRaum
Stellung der Charaktere und Kameraperspektive, mit korrekt gehaltenen räumlichen Beziehungen.
Die Geografie hört auf, zwischen Einstellungen zu wandern.
styleStil
Kinolook konsistent dargestellt, ohne Überlauf zwischen den Looks in einem Projekt mit mehreren Stilen.
Eine Farbgebung über den ganzen Satz.
Alibabas eigene Wan-3.0-Schau lässt zwei Bildreferenzen durch dreißig Sekunden schnelle Action laufen und hält Fell, Kleidung, Scheiden und Staffelung durchgehend. Das ist die Obergrenze; dein Ergebnis hängt vor allem an der Qualität der Referenzen.
Die meiste echte Arbeit ist keine lange Einstellung — es sind drei oder vier Clips, die nach derselben Produktion aussehen müssen, und die Methode dafür ist langweiliger, als sie klingt: Lass alles außer dem Prompt identisch. Dieselben Dateien Byte für Byte, dieselbe Aufgabe für jede Datei, derselbe Stilsatz am Ende, dieselbe Auflösung und dasselbe Verhältnis. Änder nur die Handlung und die Kamera. Eine leicht neu exportierte Kopie desselben Fotos noch einmal hochzuladen ist der übliche Grund, warum eine Sequenz driftet, denn die Datei ist nicht mehr identisch — Wan 3.0 hat zwischen Anfragen kein Gedächtnis, Konsistenz hängt also vollständig davon ab, was du ihm gibst.
Gib jeder Wan-3.0-Referenz eine Aufgabe
Das ist der Teil, der entscheidet, ob das Ergebnis stimmt, und hier gehen die meisten Wan-3.0-Versuche schief. Das Modell rät nicht, wofür du eine Datei hochgeladen hast — du sagst es ihm, im Prompt, über die Nummer.
Gesicht und Garderobe festhaltenDas Stärkste, was Wan 3.0 kann. Eine Person pro Bild, frontal und gut ausgeleuchtet schlägt künstlerisch jedes Mal — ein Passfoto ist besser als ein stimmungsvolles Porträt.
Image 1 ist die Frau im grauen Wollmantel; behalt ihr Gesicht, ihre Haare und den Mantel exakt.
Produkt oder Requisite festhaltenAussehen aus mehreren Winkeln, Logos, Beschläge und Material halten alle. Zwei Winkel desselben Objekts wirken besser als eine Heldenaufnahme.
Image 2 und Image 3 sind dieselbe Flasche; behalt das Etikett und den Verschluss.
Bewegung und Timing beisteuernEin Referenz-Clip ist nicht da, um kopiert zu werden — er ist da, um seinen Rhythmus beizusteuern: wie lange ein Takt hält, wie ein Übergang sich bewegt.
Video 1 steuert nur die Gehkadenz bei, nicht den Charakter.
Eine Stimme beisteuern oder den Raum setzenEine Tonreferenz setzt die Klangfarbe, und zusammen mit einer Gesichtsreferenz folgt die Lippensynchronisation ihr. Eine Ortsaufnahme fixiert Stellung und Kameraperspektive, sodass die Geografie aufhört zu wandern.
Audio 1 steuert nur die Klangfarbe bei. Image 4 setzt den Raum und die Kamerahöhe.
Schreib Image 1, nicht image1
Image 1 · Video 1 · Audio 1Wan 3.0@image1Seedance
Wan 3.0 erwartet die englische Form mit Großbuchstabe und Leerzeichen. @image1 ist Seedance-Syntax, und mehrere Anleitungen wiederholen sie hier, wo sie nicht gelesen wird. Die Nummerierung läuft je Medienart getrennt und folgt der Uploadreihenfolge — sortier deine Dateien um, und du hast eine andere Anfrage gestellt.
Zwanzig Dateien ist die Schlagzeilenzahl; die Zahl, die du tatsächlich nehmen solltest, ist viel kleiner. Ein Motiv pro Bild, eine Aufgabe pro Datei — sobald eine Datei zwei widersprüchliche Aufgaben trägt oder ein Bild zwei Personen enthält, muss das Modell raten, und Raten ist genau das, wogegen du Referenzen hochgeladen hast. Die meisten guten Szenen kommen mit drei oder vier aus. Du willst den Rest des Prompts nicht schreiben? Der Prompt-Generator schreibt ihn in Alibabas Reihenfolge.
Wenn die Wan-3.0-Konsistenz bricht, und was dann zu tun ist
Der Referenzmodus ist der einzige Weg in Wan 3.0, bei dem auch deine Eingaben abgerechnet werden, ein falsch zurückkommender Durchlauf kostet also doppelt. Das sind die fünf Arten, wie es schiefgeht, in der Reihenfolge, in der sie dir begegnen werden — und das Feld über dem Generieren-Knopf liest deinen Aufbau auf die, die es kommen sieht.
Der Charakter sieht nicht aus wie die Referenz
Fast immer, weil auf dem Bild mehr als eine Person ist oder weil dasselbe Bild zusätzlich den Ort oder den Stil festlegen sollte.
Ein Motiv pro Bild, eine Aufgabe pro Datei.
Zwei Charaktere verschwimmen dort, wo sie sich berühren
Überlappende Positionen plus gleichzeitige Handlung sind der schwerste Fall. Prüf zuerst an einer Einstellung mit klarem Abstand, dann nimm Berührung dazu.
Zwei klar getrennte Charaktere sind verlässlich; eine Menge, die sich berührt, nicht.
Die Bewegung ignoriert den Referenz-Clip
Diese Datei sollte zusätzlich einen Charakter festlegen, sie trägt also zwei Aufgaben, und das Modell muss sich für eine entscheiden.
Teil sie in zwei Dateien mit je einer Aufgabe.
Die Rechnung ist höher als erwartet
Die Sekunden eines Referenz-Clips werden zu deinem Ausgabetarif abgerechnet und zählen gegen dieselbe Obergrenze von dreißig Sekunden. Bilder, Ton, Dokumente und Links sind kostenlos.
6 s Referenz + 20 s Ausgabe = 26 abgerechnete Sekunden.
Die Anfrage wird vor dem Generieren abgelehnt
Es wurde ein erster Frame neben Referenzen geschickt. Die beiden Familien schließen sich aus, und abgelehnt wird die ganze Anfrage, nicht eine Eingabe.
Reihenfolge: Image 1 · Image 2 · Video 1 — keine Frame-Eingaben.
Fang einfach an, um die Qualität der Referenzen zu prüfen, und nimm dann Komplexität dazu. Eine Szene, die mit fünf Charakteren scheitert, klappt oft mit zweien, und zwei saubere zusammengeschnittene Clips schlagen einen matschigen.
Was ein Clip mit Referenzbild-zu-Video-KI kostet
Derselbe Sekundensatz wie in jedem anderen Modus — die Referenzen selbst kosten keinen Aufpreis. Die eine Ausnahme ist der Referenz-Clip: Seine Sekunden werden zum selben Satz wie deine Ausgabe abgerechnet. Bilder, Ton, Dokumente und Links kommen nicht dazu. Wie überall sonst wird ein fehlgeschlagener Durchlauf automatisch erstattet, eine schlechte Generierung kostet dich also nur das Warten.
So wird abgerechnet
- Abgerechnet nach
- Ausgabesekunde
- Referenzbilder · Ton · Datei · Link
- kostenlos
- Referenz-Clip
- zum Ausgabetarif abgerechnet
- Fehlgeschlagene Generierung
- erstattet
- Referenzbilder · Ton · Datei · Link
- ohne Aufpreis
Der Referenz-Clip ist die dritte Variable, die diese Seite hat und die anderen Werkzeuge nicht: Ein Referenz-Clip von 15 Sekunden auf einer Ausgabe von 15 Sekunden sind dreißig abgerechnete Sekunden, nicht fünfzehn. Entwirf in 480P und lass den Keeper einmal laufen. Alle Preise
So oder so dieselben Credits pro Monat
Das Abbild einer echten Person verwenden
Referenzbild-zu-Video-KI mit Wan 3.0 hält ein Gesicht über eine ganze Einstellung. Das ist die Funktion, und genau das macht Missbrauch leicht — die Regel hier ist deshalb kurz: Lade das Abbild einer Person nur mit ihrer Zustimmung hoch.
- GesichterVideo einer echten Person braucht ihre Einwilligung — keine Personen des öffentlichen Lebens, kein Foto einer fremden Person.
- StimmenEine Klangfarbenreferenz klont, wie eine bestimmte Person klingt. Nimm deine eigene, eine lizenzierte oder eine synthetische.
- CharaktereEin urheberrechtlich geschützter Charakter gehört dir nicht, weil ein Modell ihn neu generiert hat.
- MinderjährigeLade niemals Referenzen hoch, die Minderjährige zeigen.
- ModerationEingereichte Medien werden automatisch geprüft, Meldungen gehen an ein überwachtes Postfach, und Löschungen werden zügig bearbeitet statt irgendwann. Falsch-Positive und Falsch-Negative kommen vor.
Häufig gestellte Fragen zu Referenzbild-zu-Video-KI
Was Referenz zu Video mit Wan 3.0 über eine Einstellung stabil hält und was Referenzsekunden zur Rechnung beitragen
Muss ich mich registrieren, um Referenz zu Video auszuprobieren?
Wie viele Referenzbilder nimmt Wan 3.0?
Kann ich ein Wan-3.0-Referenzbild und einen ersten Frame zusammen benutzen?
Warum sieht mein Charakter anders aus als die Wan-3.0-Referenz?
Macht ein Referenz-Clip einen Wan-3.0-Clip teurer?
Kann Wan 3.0 neben einem Gesicht auch eine Stimme konstant halten?
Wie viele Charaktere passen in eine Wan-3.0-Einstellung?
Werden Referenzen über getrennte Wan-3.0-Generierungen hinweg mitgenommen?
Welche Formate nimmt Wan 3.0 für Referenzen an?
Darf ich die Videos kommerziell nutzen?
Besetz deine erste Wan-3.0-Szene
Lade ein Gesicht hoch, gib ihm eine Aufgabe und beschreib die Einstellung. Wan 3.0 Referenz zu Video läuft über Credits, ab 480P aufwärts — dein Material kostet keinen Aufpreis, und ein fehlgeschlagener Durchlauf wird automatisch erstattet.
Geschrieben und gepflegt von der Redaktion von wan-3.runVeröffentlicht am Zuletzt aktualisiert am Tool Version 2026.09.4
