Wan 3.0 Lippensynchronisation

Leg ein Gesicht hinein, zitier die Zeile, und der Mund folgt den Worten. KI-Lippensynchronisation mit Wan 3.0 generiert die Stimme im selben Durchlauf wie das Bild — es gibt keine Audiodatei, die vorher aufgenommen werden müsste, und keinen Synchronisationsdurchgang danach. Zwei bis dreißig Sekunden, Ton in der MP4, und dein erster Clip ist kostenlos.

Die sprechende Person

Bild erstellen

JPG · PNG · BMP · WEBP · ≤20MB · 240–8000px · Verhältnis ≤8:1

0 / 20000

The speaker keeps the same face, hair, clothing and colours throughout; only the camera and the described motion change.

Model
Aspect ratio
Duration
Resolution
Kostenlos registrieren · 1 Clip auf Wan 3.0

Der kostenlose Clip ist dasselbe Wan 3.0 mit seinem Ton, gedeckelt bei 480P · 3s, und er wartet auf geteilter Kapazität. Ein Tarif hebt die Obergrenze auf 1080P und dreißig Sekunden — die kostenlose Stufe ist eine Auflösung, kein anderes Modell.

1 kostenloser Clip auf dem echten Modell · eine E-Mail, keine Karte · den Ton einzuschalten kostet dasselbe, wie ihn aus zu lassen

Alibabas eigene Wan-3.0-Dialogdemos · „Ausprobieren“ lädt den Prompt

Eine Frau an einer Küchentheke hält einen pinkfarbenen tragbaren Mixer und spricht direkt in die KameraIN DIE KAMERA GESPROCHEN · 9:16 · 720P

Ein Stück in die Kamera, sechs Zeilen lang

Was zurückkommt

Was Wan 3.0 macht, wenn im Prompt eine Zeile steht

Jeder Clip hier ist eine Demo, die Alibaba für Wan 3.0 veröffentlicht hat, und zu jeder gab es den Prompt, aus dem sie entstand. Drück Anhören für die Stimme oder Prompt verwenden, um das Ganze in das Feld oben auf dieser Seite zu laden — in voller Länge abgedruckt, in der Sprache, in der er geschrieben wurde.

  • 1 DurchlaufBild, Sprache und Mundbewegung in einer Generierung
  • $0Aufpreis für die Tonspur
  • wan3.0-videodas Modell hinter jedem Clip in dieser Reihe
  • Eine Frau an einer Küchentheke hält einen pinkfarbenen tragbaren Mixer und spricht direkt in die KameraReferenz
    Sechs Zeilen in die Kamera, das Produkt an ein Referenzbild gebunden
  • Eine Sängerin steht mittig auf einer nächtlichen Dachbühne, dahinter ein DJ und die Skyline der StadtReferenz
    Eine Sängerin wechselt die Sprache, die Synchronität hält durch alle acht
  • Ein Mann in langem grauem Mantel und mit Schutzbrille steht in einem sonnendurchfluteten hölzernen DojoReferenz
    Zwei Sprecher, Japanisch, je eine Zeile und kein Durcheinander
  • Eine rote Katze und ein Golden Retriever mit Kopfhörern an Podcast-Mikrofonen unter einer ModelTalk-LeuchtreklameErster Frame
    Aus einem Standbild zweier Tiere werden zehn Runden Dialog

Was eine gesprochene Zeile sitzen lässt

  • Die Worte

    Zitier die genaue Zeile. Eine Umschreibung bekommt eine Zeile, die das Modell erfunden hat.

  • Sprecher

    Leg fest, wer spricht — Alter, Haare, Kleidung — sonst bewegt sich der falsche Mund.

  • Kamera

    Halt sie auf dem Gesicht, solange die Zeile läuft.

  • Text

    Schließ mit no subtitles, sonst kann die Zeile im Bild gedruckt ankommen.

Aus einem Text-Prompt

KI-Lippensynchronisation aus einfachen Text-Prompts

Kein Skriptformat, keine Zeitleiste, keine Sprachdatei. Beschreib die Einstellung in gewöhnlichen Sätzen, zitier die Worte, die die Figur sagt, und ordne sie der Person vor der Kamera zu — Wan 3.0 rendert das Bild, synthetisiert die Stimme und bewegt den Mund dazu, in einer einzigen Anfrage.

Ein Prompt, eine gesprochene Zeile

Medium A-roll. The woman stands behind the kitchen counter
holding the pink portable blender, speaking naturally to camera.
She says: "I get asked how I make smoothies so quickly."
No subtitles, no text overlays, no UI, no watermark.

  • Einstellung, Kamera und wer spricht
  • Die zitierte Zeile und was nicht gedruckt werden darf
2484 / 20,000

Ein Durchlauf heraus

Eine Frau an einer Küchentheke hält einen pinkfarbenen tragbaren Mixer und spricht direkt in die Kamera9:16 · 720P · 30S

wan3.0-video · 16:9 · 720P · 14 s · Sprache und Mund im selben Durchlauf

Diese vier Zeilen stammen aus Alibabas eigener Dreißig-Sekunden-Demo, die auf 2.484 Zeichen kommt — bei einer Obergrenze von 20.000. Sie stehen hier unübersetzt, weil sie ein Zitat sind, und weil Wan 3.0 Prompts auf Englisch und Chinesisch garantiert: Die Struktursätze bleiben englisch, dein eigener Inhalt darf deutsch sein. Der Platz ist da, um Sprecher, Produkt und Ausschlüsse festzunageln, nicht um mehr zu schreiben. Ob du ein Porträt hochlädst oder eines beschreibst, ändert an der Zeile selbst nichts.

Bevor du einen Credit ausgibst

Verbessere deinen Lipsync-Prompt mit KI

Ein Durchlauf, der falsch zurückkommt, ist fast nie ein Problem des Modells. Es ist ein Prompt, der das Bild benannt und die Sprechweise, die Kamera und die Untertitelregel dem Zufall überlassen hat.

Der Prompt-Generator nimmt die Zeile, die gesagt werden soll, und gibt einen vollständigen Wan-3.0-Prompt darum herum zurück — Sprecher festgelegt, eine Kamerabewegung benannt, die Tonebenen geordnet und die Zeile abgegrenzt, damit sie gesprochen und nicht erzählt wird. Er prüft das Ergebnis gegen die Regeln, die dieses Modell wirklich durchsetzt, sodass der Satz, den alle vergessen, hinzukommt, bevor der Credit ausgegeben ist, und nicht danach.

  1. 01

    Tipp die Zeile ein, die gesagt werden soll

    Ein Satz reicht zum Anfangen. Wer sie sagt und wo, darf ein Fragment sein.

  2. 02

    Bekomm einen Prompt, der darum herum gebaut ist

    Sprecher, Kamera, Tonebenen und die abgegrenzte Zeile, in der Reihenfolge, in der Wan 3.0 sie liest.

  3. 03

    Schick ihn hierher und füg das Gesicht dazu

    Der Prompt landet im Feld oben auf dieser Seite, Länge und Verhältnis schon gesetzt.

Prompt-Generator öffnen

Du schreibst die Zeile für eine bezahlte Anzeige statt für ein Stück in die Kamera? Der UGC-Werbevideo-Generator hat die Wortzahl, die fünfzehn Sekunden wirklich tragen, und die Kennzeichnungsregeln, die darüber entscheiden, ob sie läuft.
Du hast schon einen Clip, dessen Sprechweise dir gefiel? Video zu Prompt transkribiert die gesprochene Zeile und gibt sie in geschweiften Klammern zurück — in der Form, die dieses Modell spricht statt erzählt.

Von Anfang bis Ende

Ein vollständiger KI-Ablauf, vom Skript zum Video

Vier Türen zum selben Endpunkt. Was auch immer du in der Hand hast — einen Absatz Skript, ein Deck, ein Porträt oder einen Clip, den du schon gerendert hast — es gibt einen Weg davon zu einer sprechenden Einstellung, und keiner davon braucht ein angeschraubtes Sprachwerkzeug.

  • Ein junger Mann und eine ältere Frau spielen an einem Tisch auf einem belebten Stadtplatz Schach

    Skript → Prompt

    Gib die Zeile her und bekomm eine vollständige Einstellungsbeschreibung darum herum, mit festgelegtem Sprecher und der Zeile bereits ihm zugeordnet.

    Kostenlos · keine Credits
  • Ein Fernverkehrs-Lkw auf freier Autobahn klappt zu einer laufenden Maschine aus

    Deck oder Seite → Skript

    Aus einem PDF oder einer öffentlichen URL wird die Geschichte, aus der die Einstellung gebaut wird, statt Folien mit einem Avatar davor.

    50 Seiten · 100 MB
  • Zwei Männer in Anzügen in einer gefliesten Bürotoilette, einer von ihnen mitten in einer Zeile

    Porträt + Zeile → sprechende Einstellung

    Das Gesicht geht als Frame eins hinein, die Zeile geht zitiert und zugeordnet hinein, und der Mund folgt ihr.

    2–30 s · bis 1080P
  • Dieselbe rothaarige Frau, gehalten über eine Totale, ein Aufzuginneres und eine Nahaufnahme in einem Einkaufsatrium

    Neue Zeile, gleiche Einstellung

    Änder, was ein vorhandener Clip sagt, ohne ihn neu zu drehen: Sprecher, Timing und Bildausschnitt bleiben, und die Lippenbewegung wird neu generiert.

    Material, das du schon hast

Alles oben landet an derselben Stelle — Meine Werke behält die MP4, den Prompt und die Task-ID für jeden Durchlauf, eine Einstellung, die dir gefiel, lässt sich also wieder öffnen statt rekonstruieren.

Das ganze Verfahren

Ein Foto lippensynchron sprechen lassen mit Wan 3.0

Der Schritt, den Leute falsch machen, ist der dritte: das Bild zu beschreiben, das das Modell schon sieht, statt die Worte zu schreiben, die es nicht erraten kann.

  1. Leg das Gesicht hinein

    Die Prüfung läuft sofort, in deinem Browser. Eine gute Datei zeigt eine grüne Zeile; eine schlechte benennt die Lösung, bevor du etwas ausgibst.

    Kostenlos geprüft
  2. Zitier die Zeile und sag, wer sie sagt

    Die genauen Worte in Anführungszeichen, der Person vor der Kamera zugeordnet. Eine Umschreibung — „sie sagt etwas Beruhigendes“ — bringt dir eine Zeile, die das Modell erfunden hat.

    Nur genaue Worte
  3. Schließ mit „no subtitles“

    Es gibt kein Feld für Negativ-Prompts, die Anweisung, die Zeile nicht zu drucken, ist also ein Satz wie jeder andere. Es ist ein Nebensatz, und er rettet einen ganzen Durchlauf.

    Ein Satz
  4. Länge und Auflösung setzen, dann generieren

    Kauf zuerst die Sekunden, die die Zeile braucht. Zurück kommt eine MP4 mit Sprache, Raumton und Mundbewegung schon darin.

    Bis zu 1080P

Rund neunzig Sekunden für einen kurzen Clip, und du kannst den Tab schließen, während er läuft. Das hochgeladene Foto wird nie verändert — die Ausgabe ist eine neue Datei.

Was Lippensynchronisation hier heißt

Dein Foto ist Frame eins. Die Stimme wird geschrieben, nicht hochgeladen.

Die meisten Werkzeuge dieser Art nehmen ein Bild und eine Audiodatei und bewegen den Mund passend dazu. Dieses nimmt ein Bild und einen Satz.

Ein Porträt als Anfangsframe eines Wan-3.0-Clips mit Lippensynchronisation

Frame 001 · dein Gesicht

Ab hier gesprochen und synchronisiert

KI-Lippensynchronisation mit Wan 3.0 setzt dein Foto buchstäblich als ersten Frame ein und generiert von dort 2 bis 30 Sekunden nach vorn, bei 30 fps in 480P, 720P oder 1080P. Die Worte, die du zitiert hast, kommen als Sprache in der eigenen Tonspur dieses Clips zurück, und der Mund bewegt sich dazu, weil Bild und Ton im selben Durchlauf gerendert werden statt in zweien zusammengenäht.

Dein Foto ist Frame eins
001

Dein Foto ist Frame eins

Audiodateien, die du liefern musst
0

Audiodateien, die du liefern musst

Jede ganze Sekunde
2–30 s

Jede ganze Sekunde

MP4 zurück, Ton schon darin
1

MP4 zurück, Ton schon darin

  • Kein Text-zu-Sprache-Schritt vor dem Rendern
  • Kein Synchronisationsdurchgang danach
  • Kein zweites Modell, das man für den Mund lizenzieren müsste

Die Zeile

Was entscheidet, ob eine Zeile gesprochen oder quer übers Bild gedruckt wird

Zwei Sätze entscheiden, ob eine Zeile gehört oder gelesen wird. Der eine legt die genauen Worte in den Mund der sprechenden Person; der andere hält sie aus dem Bild. Lass einen davon weg, und der Fehlschlag kommt als fertiges, abgerechnetes Video an.

Die Anatomie einer synchronen Zeile

Sprache und Bild · ein Durchlauf

…speaking naturally to camera. She says:"It blends everything smooth."

Realistic kitchen ambience, blending motor, casual room tone.No subtitles, no text overlays.

Eine rote Katze und ein Golden Retriever mit Kopfhörern an Podcast-Mikrofonen unter einer ModelTalk-LeuchtreklameZehn Runden · 720P · 30 s
Zwei Sprecher, zehn Runden, und nur der, der spricht, öffnet den Mund — für Ton drücken

Was der Mund braucht, um zu sitzen

3

  • Die genauen Worte, zitiert statt zusammengefasst
  • Eine sprechende Person, genau genug beschrieben, um sie festzulegen
  • Die Kamera auf ihrem Gesicht, während sie spricht

Die Regel, die alle übersehen

Es gibt kein Feld für Negativ-Prompts, „das hier nicht drucken“ ist also ein Satz im Prompt wie jeder andere. Lass ihn weg, und das Modell darf deinen Dialog als etwas behandeln, das es zusätzlich zum Sprechen auch ins Bild zeichnet — und genau deshalb endet Alibabas eigene Dreißig-Sekunden-Demo, oben abgedruckt, auf exakt dieser Anweisung.

  • no subtitles, no text overlaysRichtig
  • Negative prompt: subtitlesFalsch

Alles, was wie ein Negativ-Prompt aussieht, wird als weitere zu rendernde Worte gelesen, und die Anfrage läuft trotzdem durch — der Fehlschlag kommt also als fertiger Clip an, mit der Beschriftung „Negative prompt“ irgendwo im Bild.

Geschweifte Klammern gehen auch — {like this} ist das, was die Prompt-Werkzeuge dieser Website ausgeben. Worauf das Modell wirklich achtet, ist eine abgegrenzte Zeile mit einer sichtbar zugeordneten sprechenden Person, und Alibabas eigene veröffentlichte Prompts benutzen dafür Anführungszeichen. Text zu Video behandelt die vier Tonebenen und die Reihenfolge, in der man sie benennt.

Bevor du ausgibst

Prüf das Porträt, bevor du einen Credit ausgibst

Ein Gesicht, das Wan 3.0 nicht lesen kann, ist der ärgerlichste Weg, eine Generierung zu verlieren, denn du erfährst es nach der Warteschlange statt davor. Leg das Foto hier ab, und es wird gegen die echten Grenzen geprüft — Format, Größe, Maße, Verhältnis und Transparenz — mit der Lösung neben der Zeile, die durchfällt. Nichts wird hochgeladen: Die Prüfung läuft in deinem Browser.

JPG · JPEG · PNG · BMP · WEBP · ≤20.0 MB · 2408,000px · ratio ≤8:1

Ein Gesicht, so gerahmt, dass der Mund nicht das Kleinste im Bild ist, gibt der Synchronität am meisten zum Arbeiten. Die Prüfung rührt das Modell nie an, ein Porträt, das ohnehin nicht gelesen worden wäre, kostet also nichts an Erkenntnis.

Was hineingeht

Grenzen der Wan-3.0-Lippensynchronisation — Porträt, Clip und Stimme

Fünf dieser Zeilen regeln das Foto, zwei regeln, was herauskommt, und die letzte ist die, die eine Ablehnung produziert, mit der niemand rechnet. Das Uploadfeld oben auf dieser Seite prüft die Bildzeilen, bevor du etwas ausgibst.

Ein festgelegter erster Frame und eine Sprachaufnahme können nicht zusammen reisen. Frames sind die eine Eingabefamilie und Referenzen die andere; eine Anfrage, die beide trägt, wird rundheraus abgelehnt statt heruntergestuft — die Entscheidung fällt also vor dem Hochladen.

Porträtformat
JPEG · JPG · PNG · BMP · WEBPHEIC wird abgelehnt — der Standardcontainer eines iPhones steht nicht auf der Liste
Offiziell
Porträtgröße
≤ 20 MB
Offiziell
Maße
240 – 8.000 px pro Seite
Offiziell
Seitenverhältnis
8:1 – 1:8Ein Bereich, keine Obergrenze — eine 1:9-Spalte wird abgelehnt wie ein 9:1-Banner
Offiziell
Transparenz
nicht angenommenEin PNG-Alphakanal wird abgelehnt statt zusammengerechnet
Offiziell
Cliplänge
2 – 30 s bei 30 fpsJede ganze Sekundenzahl, in 480P, 720P oder 1080P
Offiziell
Stimmreferenz
5 Spuren · ≤ 15 s insgesamtWAV oder MP3, je bis 15 MB, 1–15 s pro Spur
Offiziell
Frames und Referenzen
schließen sich aus
Offiziell

Die Zeile selbst hat kein eigenes Feld und keine eigene Grenze: Sie steht mit allem anderen im Prompt, und der fasst 20.000 Zeichen. Was eine gesprochene Zeile begrenzt, ist die Uhr, nicht die Zeichenzahl — etwa zwei bis drei Sekunden Bildzeit pro kurzem Satz, eine Zeile mit fünfzehn Wörtern in einem Clip von vier Sekunden wird also entweder gehetzt oder abgeschnitten. Kauf die Sekunden, die die Zeile braucht, bevor du die Auflösung kaufst.

Preise · 1080P in jedem kostenpflichtigen Tarif · Ton nativ

Was ein Clip mit Wan-3.0-Lippensynchronisation kostet

Länge und Auflösung setzen den Preis. Sprache nicht: Der Tonschalter ändert, was zurückkommt, nicht was es kostet, und eine Stimmreferenz wird gar nicht abgerechnet. Ein fehlgeschlagener Durchlauf wird automatisch erstattet, und die Prüfung oben hält die meisten vermeidbaren Fehlschläge von vornherein vom Modell fern.

So wird abgerechnet

Abgerechnet nach
Ausgabesekunde
Sprache, Stimmreferenz
ohne Berechnung
Dein erster Clip
kostenlos · 480P

Arbeite die Zeile in 480P durch, bis die Sprechweise sitzt, und gib dann einen Durchlauf für 720P oder 1080P aus — das Porträt muss zwischen den Durchläufen nicht neu geprüft werden. Alle Preise.

So oder so dieselben Credits pro Monat

  • Erster Clip kostenlosOhne Karte

    Eine Generierung auf dem echten wan3.0-video. Sieh, was Wan 3.0 aus deiner eigenen Einstellung macht — 480P, drei Sekunden, Ton im selben Durchlauf.

    $0einmalig

    Zu keinem Zeitpunkt eine Karte

    Kostenlosen Clip generieren

    Eine E-Mail, keine Karte

    1 Clip, einmalig

    480P · bis zu 3 s · mit Ton
    Eine E-Mail, keine Karte

    Dasselbe `wan3.0-video`, das Alibaba für die kostenpflichtigen Tarife fährt — 480P ist eine Auflösung, kein schwächeres Modell

    • Das echte wan3.0-video, nicht 2.7
    • Ton entsteht mit dem Bild
    • Modell-ID und Task-ID auf dem Beleg
    • Ein fehlgeschlagener Durchlauf kostet dich nie etwas
    • 720P und 1080PKostenpflichtig
    • Clips länger als 3 SekundenKostenpflichtig
    • Referenz-, Dokument- und BearbeitungsmodusKostenpflichtig
    • Überhaupt mehr als ein ClipKostenpflichtig

    Eine Frage wird beantwortet: was Wan 3.0 aus deiner Idee macht. 1080P, dreißig Sekunden und jeder Eingabemodus beginnen bei $12.90.

    Auf einen Blick

    Clips pro Monat
    1, einmalig
    Takes pro Durchlauf
    1
    Längster Clip
    3s
    Höchste Auflösung
    480P
  • StarterBis zu 20 % sparen

    Ein Launch-Post pro Woche. Genug, um herauszufinden, ob der Wan 3.0 KI-Video-Generator zu deiner Arbeitsweise passt, ohne dich auf ein Volumen festzulegen.

    $12.90/Monat$15.90

    $154.80 jährlich abgerechnet

    Jederzeit kündbar

    640 Credits / Monat · ≈ 16 Clips

    mit 5 s in 480P · 8 in 720P · 4 in 1080P

    Tarif-Credits verfallen am Monatsende

    • 640 Credits pro Monat — etwa 16 fertige Clips
    • 2 Takes eines Prompts pro Durchlauf
    • Jede Auflösung — 480P, 720P und 1080P
    • Jede Länge — 2 bis 30 Sekunden in einem Durchlauf
    • Jede Eingabe — Text, Bild, Referenz, Dokument, Webseite
    • Ton im selben Durchlauf geschrieben, ohne Wasserzeichen
    • Kommerzielle Nutzung inklusive — veröffentlichen, verkaufen, abrechnen
    • Wan 3.0 Prime, die schnelle Stufe, wann immer du sie willst
    • Ein fehlgeschlagener Durchlauf kostet nie Credits
    • 7 Tage Erstattung, solange die Credits unangetastet sind
    • Mit zwei Klicks kündbar — der Preis beim Einstieg bleibt festgeschrieben

    Alles unterhalb der ersten beiden Zeilen steckt für $12.90 in diesem Tarif. Die größeren Tarife kaufen Sekunden und Takes — nie ein besseres Modell.

    Auf einen Blick

    Clips pro Monat
    ≈ 12 mit 5 s in 480P
    Takes pro Durchlauf
    2
    Credits pro Dollar
    Ausgangswert
    Erstattungsfrist
    7 Tage
  • Hier landen die meisten
    Pro

    Ein fertiger Clip an jedem Arbeitstag, mit jeweils drei Alternativen. Die Schleife aus Entwurf in 480P und Finale in 1080P, zugeschnitten auf eine Arbeitswoche.

    $39.90/Monat$49.90

    $478.80 jährlich abgerechnet

    Jederzeit kündbar

    2.240 Credits / Monat · ≈ 56 Clips

    mit 5 s in 480P · 28 in 720P · 14 in 1080P

    Tarif-Credits verfallen am Monatsende

    • 2.240 Credits pro Monat — 3,5× Starter
    • ≈ 56 fertige Clips pro Monat oder 14 in vollem 1080P
    • 4 Takes eines Prompts pro Durchlauf — einen auswählen statt neu würfeln2× Takes
    • +13 % Credits pro Dollar gegenüber StarterBesserer Kurs
    • Platz, um in derselben Woche in 480P zu entwerfen und in 1080P fertigzustellen
    • Jede Auflösung — 480P, 720P und 1080P
    • Jede Länge — 2 bis 30 Sekunden in einem Durchlauf
    • Jede Eingabe — Text, Bild, Referenz, Dokument, Webseite
    • Ton im selben Durchlauf geschrieben, ohne Wasserzeichen
    • Kommerzielle Nutzung inklusive — veröffentlichen, verkaufen, abrechnen
    • Wan 3.0 Prime, die schnelle Stufe, wann immer du sie willst
    • Ein fehlgeschlagener Durchlauf kostet nie Credits
    • 7 Tage Erstattung, solange die Credits unangetastet sind
    • Mit zwei Klicks kündbar — der Preis beim Einstieg bleibt festgeschrieben

    Der Sprung von Starter bringt Menge, Takes und Kurs. Das Modell, die Auflösungen und die dreißig Sekunden hattest du schon.

    Auf einen Blick

    Clips pro Monat
    ≈ 44 mit 5 s in 480P
    Takes pro Durchlauf
    4
    Credits pro Dollar
    +21 % ggü. Starter
    Erstattungsfrist
    7 Tage
  • StudioBester Kurs

    Kundenvolumen, und der Tarif, in dem du aufhörst, 1080P zu rationieren. Einunddreißig fertige Clips in voller Auflösung pro Monat, zum niedrigsten Preis pro Credit, den wir verkaufen.

    $99.90/Monat$119.90

    $1,198.80 jährlich abgerechnet

    Jederzeit kündbar

    6.240 Credits / Monat · ≈ 156 Clips

    mit 5 s in 480P · 78 in 720P · 39 in 1080P

    Tarif-Credits verfallen am Monatsende

    • 6.240 Credits pro Monat — 9,75× Starter, 2,8× Pro13×
    • ≈ 156 fertige Clips pro Monat oder 39 in vollem 1080P
    • +26 % Credits pro Dollar — der beste Kurs, den wir verkaufenBester Kurs
    • Genug 1080P, dass du aufhörst, erst in 480P zu entwerfen
    • 4 Takes eines Prompts pro Durchlauf
    • Zugeschnitten auf eine Kundenliste statt auf einen Kanal
    • In jedem Monat aufstocken, ohne den Tarif zu wechseln
    • Jede Auflösung — 480P, 720P und 1080P
    • Jede Länge — 2 bis 30 Sekunden in einem Durchlauf
    • Jede Eingabe — Text, Bild, Referenz, Dokument, Webseite
    • Ton im selben Durchlauf geschrieben, ohne Wasserzeichen
    • Kommerzielle Nutzung inklusive — veröffentlichen, verkaufen, abrechnen
    • Wan 3.0 Prime, die schnelle Stufe, wann immer du sie willst
    • Ein fehlgeschlagener Durchlauf kostet nie Credits
    • 7 Tage Erstattung, solange die Credits unangetastet sind
    • Mit zwei Klicks kündbar — der Preis beim Einstieg bleibt festgeschrieben

    Der Tarif für eine Kundenliste statt für einen Kanal: vier Takes jedes Prompts, 1080P ohne Rationierung und Platz, eine Szene neu zu drehen, ohne den Stand fallen zu sehen.

    Auf einen Blick

    Clips pro Monat
    ≈ 124 mit 5 s in 480P
    In vollem 1080P
    ≈ 31 pro Monat
    Credits pro Dollar
    +28 % ggü. Starter
    Erstattungsfrist
    7 Tage

Fragen

Wan-3.0-Lippensynchronisation — die Fragen, mit denen Leute wirklich ankommen

Die, die sich vor dem Hochladen eines Gesichts zu beantworten lohnen, mit Zahlen aus Alibabas eigener Parametertabelle statt aus einer Funktionsliste.

Brauche ich eine Audiodatei für die Lippensynchronisation?

Nein — du kannst also aufhören zu suchen. Zitier die Worte im Prompt und ordne sie der Person vor der Kamera zu — She says: "Two minutes to set up." — und Wan 3.0 generiert die Sprache selbst, im selben Durchlauf wie das Bild, mit dem Mund passend dazu. Ein Foto und ein Satz sind die ganze Eingabe. Eine Sprachaufnahme ist der andere Weg, für den Fall, dass die Klangfarbe eine bestimmte sein muss.

Wie schreibe ich die Zeile, damit sie gesprochen und nicht beschrieben wird?

Zitier sie und häng sie an jemanden. Alibabas eigene Prompt-Formel stellt den gesprochenen Inhalt neben die Emotion, den Ton und den Akzent, die er tragen soll, und jede Demo auf dieser Seite folgt ihr — She says: "…", dann die Sprechweise. Worte, die nur zusammengefasst sind, werden stattdessen erzählt oder erfunden. Die Prompt-Werkzeuge dieser Website setzen Zeilen in geschweifte Klammern, {like this}, was dieselbe Aufgabe erfüllt: zu markieren, wo die Zeile anfängt und aufhört.

Meine Zeile kam auf dem Bildschirm gedruckt an statt gesprochen. Warum?

Weil nichts im Prompt gesagt hat, sie nicht zu drucken. Dieses Modell hat kein Feld für Negativ-Prompts, Ausschlüsse sind also gewöhnliche Sätze — schließ mit „no subtitles, no text overlays“, und die Zeile wird zu Ton. Negative prompt: subtitles zu schreiben bewirkt das Gegenteil: Diese Worte werden zu etwas, das gezeichnet wird.

Kann ich mein Foto und meine Sprachaufnahme zusammen hochladen?

Nicht in einer Anfrage. Ein Foto, das als erster Frame festgelegt ist, gehört zur Frame-Familie, und eine Tonspur gehört zur Referenzfamilie, und die beiden Familien schließen sich aus — die Anfrage wird abgelehnt statt heruntergestuft. Wähl eines: den exakten Anfangsframe mit generierter Stimme, oder deine aufgenommene Stimme mit dem Bild als Referenz.

Wie lang darf die Zeile sein?

Lang genug für die Sekunden, die du gekauft hast. Das Prompt-Feld fasst 20.000 Zeichen und der Clip 2 bis 30 Sekunden bei 30 fps, die Begrenzung ist also die Uhr: In Alibabas eigene Dreißig-Sekunden-Demo oben passen sechs gesprochene Zeilen, also grob ein kurzer Satz pro fünf Sekunden, wenn man die B-Roll-Takte mitzählt. Eine Zeile, die überzieht, wird gehetzt oder abgeschnitten, und keine Prompt-Länge repariert das — kauf stattdessen mehr Sekunden.

In welchen Sprachen funktioniert die Lippensynchronisation?

In mehr, als du vermuten würdest, und der Beleg steht auf dieser Seite: Der Dachclip oben ist Alibabas eigene Demo einer Sängerin, die durch acht Sprachen wechselt, während die Synchronität hält, und der Dojo-Clip führt seinen Dialog auf Japanisch. Was es nicht gibt, ist eine veröffentlichte Liste unterstützter Sprechsprachen oder irgendeinen Parameter für Phonem-Fixierung — behandle eine anderswo genannte konkrete Zahl also als Vermutung. Lass drei Sekunden in 480P in der Sprache laufen, die du brauchst: Das kostet einen Bruchteil eines fertigen Clips und beantwortet die Frage für deinen Fall.

Können zwei Personen im selben Clip sprechen?

Ja, und der Podcast-Clip oben zeigt zwei davon in zehn Runden. Gib jeder sprechenden Figur eine eindeutige Bezeichnung und genug Beschreibung, um sie auseinanderzuhalten, verankere jede Zeile an etwas, das diese Figur sichtbar tut, und schreib die Zeilen dann in der Reihenfolge, in der sie gesagt werden. Alibabas Hinweis ist ausdrücklich: Pronomen verschmelzen Sprecher — „er sagt … dann sagt er“ ist die Art, wie aus zwei Figuren eine Stimme wird.

Kostet die Sprache extra?

Nein. Abgerechnet wird nur nach Ausgabesekunde und Auflösung, ein Clip mit Dialog kostet also genau so viel wie derselbe Clip in Stille. Referenzbilder und Referenzton werden ebenfalls nicht abgerechnet. Die eine Eingabe, die die Rechnung erhöht, ist ein Referenz-Clip — seine Sekunden werden zum Ausgabetarif zusätzlich zu den Sekunden berechnet, die du verlangt hast.

Bleibt der Rest des Bildes still, während gesprochen wird?

Nur wenn du es sagst. Dein Foto ist Frame eins, keine festgefrorene Platte — alles danach wird generiert, Raum, Licht und Bildausschnitt driften also, wenn der Prompt sie nicht festnagelt. Beide Alibaba-Demos oben verwenden genau dafür einen ganzen Absatz und benennen, was identisch bleiben muss; die Aussehensfixierung neben dem Prompt-Feld schreibt denselben Satz für dich.

Darf ich einen sprechenden Clip kommerziell veröffentlichen?

Ja. Kommerzielle Nutzung ist in jedem kostenpflichtigen Tarif enthalten, ohne Wasserzeichen und ohne separate Lizenz zum Kaufen, nach Alibabas Nutzungsrichtlinie und unseren AGB. Die Grenze ist nicht die Lizenz, sie ist das Gesicht: Die Person auf dem Foto und die Stimme auf der Aufnahme müssen beide zugestimmt haben.

Ein Gesicht, ein Satz

Lade das Porträt hoch, zitier die Zeile, die gesagt werden soll, und hör, was zurückkommt. Ein kostenloser Wan 3.0-Clip in 480P, bis zu drei Sekunden — eine E-Mail, keine Karte. Ist die Sprechweise nicht die, die du dir vorgestellt hast, hat sie dich nichts gekostet.

Geschrieben und gepflegt von der Redaktion von wan-3.runVeröffentlicht am Zuletzt aktualisiert am Tool Version 2026.09.4