KI-Erklärvideo
Das Briefing lautet nie „mach es spannend“. Es lautet: Erklär die Sache korrekt, in unserer Sprache, ohne zu viel zu versprechen, und bring es an der Person vorbei, die es freigeben muss. Schreib die Einstellung, zitier die Zeile, und Wan 3.0 generiert Bild und Sprechertext zusammen. Dein erster Clip ist kostenlos — eine E-Mail, keine Karte.
Vier von Wan 3.0 selbst veröffentlichte Erklärvideo-Durchläufe, jeder mit dem ganzen Prompt neben dem Clip abgedruckt, den er ergeben hat · „Ausprobieren“ lädt den Prompt
VIER EINSTELLUNGEN · 120s VERLANGT · 30s ZURÜCKEin Fach-Erklärvideo, dessen Zeitplan viermal zu lang war
Woraus ein KI-Erklärvideo
hier gebaut ist
Kein Skript-Upload, keine Stimmenbibliothek, keine Timeline. Du schreibst eine Einstellung nach der anderen und zitierst, was darin gesagt wird, und der Clip kommt mit den Worten schon gesprochen zurück.

Eine Einstellung nach der anderen
Bild, Darstellung und Sprechertext zusammen generiert
Jedes andere Erklärvideo-Werkzeug verlangt, dass du einen Avatar wählst, ein Skript einfügst und auf ein Rendering wartest. Wan 3.0 nimmt eine geschriebene Einstellung — was im Bild ist, was die Kamera tut, und die Zeile in Anführungszeichen — und generiert Bild und Sprache im selben Durchlauf, als eine MP4. Schreib auf Englisch, Chinesisch, Japanisch oder Koreanisch. Ein ganzer Film ist genau das, wiederholt: Es gibt keinen Parameter für die Anzahl der Einstellungen, ein Erklärvideo von zwei Minuten sind also zwölf bis zwanzig getrennte Generierungen, die du zusammenschneidest. Das Fehlen ist nachprüfbar statt eine Klage — Alibabas API-Referenz listet jeden Parameter auf, den das Modell nimmt, und eine Anzahl von Einstellungen ist nicht darunter; die Obergrenze für eine Anfrage liegt bei 30 Sekunden.
- Der Sprechertext, zitiert
- Im Prompt
- Prompt und gesprochene Zeile
- 4 Sprachen
- Pro Einstellung, bei 30 fps
- 2–30 s
- Generierungen in einem Film von 2 Minuten
- ≈ 12–20
Der Sprechertext, zitiert
Prompt und gesprochene Zeile
Pro Einstellung, bei 30 fps
Generierungen in einem Film von 2 Minuten
- Kein Knopf von Skript zu Film — du schreibst und schneidest die Einstellungen selbst
- Keine Avatar-Bibliothek — der Sprecher wird generiert, oder er ist dein eigenes Referenzbild
- Keine Untertitelspur — verlang keinen Text im Bild und setz die Untertitel in deinem Schnittprogramm
Vom Dokument aus anfangen, oder von der Einstellungsliste
Die meisten Erklärvideos existieren schon irgendwo — als Deck, als Datenblatt oder als Produktseite. Ob du das abgibst oder die Einstellungen selbst schreibst, ändert, wer über die Geschichte entscheidet.
Datei · LinkDie Quelle abgebenDokument oder LinkEin Deck, ein Bericht oder ein PDF mit bis zu fünfzig Seiten, oder eine öffentliche Webseite. Wan 3.0 liest es und entscheidet, was sich zu zeigen lohnt. Schnell, und das Modell wählt die Höhepunkte — was für eine Zusammenfassung in Ordnung ist und für einen Compliance-Punkt, der ins Bild muss, falsch.
eine Einstellung, eine ZeileDie Einstellungen schreibenDiese SeiteEine Generierung pro Einstellung, jede mit ihrem eigenen Frame, ihrer eigenen Handlung und ihrer eigenen zitierten Zeile. Langsamer, und du entscheidest über jede Aussage, die auftaucht. Das ist der Weg, den die Konten hier, die Zertifizierungs- und Sicherheitsfilme machen, tatsächlich nehmen.
Gib die Quelle ab, wenn der Film eine Zusammenfassung ist und niemand ihn prüfen wird: Dokument zu Video nimmt fünfzig Seiten, URL zu Video nimmt eine öffentliche Seite.
Schreib die Einstellungen, wenn ein bestimmter Satz gesagt werden muss, ein bestimmtes Zeichen auftauchen muss oder eine bestimmte Sache nicht gezeigt werden darf. Das ist langsamer und der einzige Weg, auf dem du die Aussage in der Hand hast. Muss ein Produkt, ein Maskottchen oder ein Prüfzeichen den ganzen Schnitt überstehen, bau den Haltesatz zuerst auf Konsistente Charaktere.
Sechs Dinge, an denen ein Erklärvideo im Unternehmen scheitert
Das sind keine ästhetischen Probleme. Jedes einzelne ist der Grund, warum ein fertiger Film noch eine Runde bei der Person dreht, die ihn freigeben muss.
Es muss warnen, ohne den Schaden zu zeigen
Ein Sicherheitsfilm darf den Unfall nicht darstellen, und „zeig X nicht“ ist eine schwache Anweisung — eine Sache zu benennen setzt sie dem Modell in den Kopf
Beschreib die Prüfung, nicht das Versagen: den Aufbau, die Anzeige, die Hände, die haltende Last. Schreib, was im Bild ist, statt was verboten ist
Aufbau des PromptsEs klingt wie eine Werbung
Der Standard-Tonfall jedes Videomodells ist hell, warm und beschwingt, weil sein Material größtenteils so ist
Nenn den Tonfall als Auflage neben dem Bild: „dokumentarisch, matte Oberflächen, gedeckte Farbpalette, keine Musik, zurückgenommene Sprechweise“. Tonfall ist ein Prompt-Feld wie jedes andere
Aufbau des PromptsDas Prüfzeichen oder Logo kommt falsch heraus
Zeichen sind klein, kontrastreich und rechtlich exakt — drei Eigenschaften, in denen Generierung am schwächsten ist
Halt es mit dem Haltesatz, lass die Kamera in dieser Einstellung stehen, und kopier das echte Zeichen hinterher darüber, wenn es pixelgenau sein muss. Prüfzeichen sind eingetragene Marken mit veröffentlichten Darstellungsregeln — Japans SG-Zeichen ist ein durchgerechnetes Beispiel —, eine generierte Beinahe-Kopie ist also ein anderes Objekt als das Zeichen, das du zeigen darfst, so überzeugend der Frame auch aussieht
Lies den Frame vor dem VeröffentlichenDer Film ist kürzer als der Zeitplan, den du geschrieben hast
Eine Einstellungsliste wird nur befolgt, wenn ihre Sekunden auf etwas hinauslaufen, das das Modell rechnen kann. Jenseits von 30 Sekunden wird der Zeitplan nicht abgelehnt — er wird zusammengedrückt, stillschweigend, und jeder Takt bekommt weniger Zeit, als du ihm gegeben hast
Mach die letzte Zahl in deiner Einstellungsliste zu 30 oder weniger, und sag die Gesamtlänge in der ersten Zeile laut an. Alle vier Beispiele oben auf dieser Seite sind Wans eigene, und sie teilen sich zwei zu zwei: Die beiden, die 120s und 150s verlangt haben, kamen mit 30,0s und 25,0s zurück, vier und fünf Einstellungen hineingequetscht, während die beiden, die vorab dreißig Sekunden angesagt haben — eines davon eröffnet mit „This video contains 6 shots, with a total duration of 30.0 seconds“ —, mit 30,0s und 30,1s zurückkamen und ihre Takte behielten. Spiel sie gegen die Prompts, die daneben abgedruckt sind; die Rechnung steht auf der Seite
Aufbau des PromptsEinstellung sieben passt nicht zu Einstellung zwei
Es gibt keinen Parameter für die Anzahl der Einstellungen und kein Gedächtnis zwischen Generierungen. Ein Film besteht aus getrennten Anfragen, die einander nie begegnet sind
Leg Palette, Objektiv und Licht in einem Stilblock fest, den du in jeden Prompt einfügst, und schick jedes Mal dieselben Referenzbilder mit. Referenz zu Video
Der Sprechertext hat den falschen Tonfall für die Sprache
Eine aus dem Englischen übersetzte Zeile behält den englischen Rhythmus, und eine japanische oder koreanische Prüferin hört das sofort
Schreib die gesprochene Zeile selbst in der Zielsprache und lass nur den Haltesatz auf Englisch. Genau diese Kombination nehmen hier die Konten, die nicht-englische Markenarbeit produzieren
Ein Durchlauf, der rundheraus scheitert, wird automatisch erstattet. Keines der fünf oben scheitert — jedes kommt fertig und unbrauchbar zurück, und das wird abgerechnet. Entwirf jede Einstellung in 480P, bis Tonfall und Auflagen halten, und lass dann die Keeper noch einmal laufen.
Was ein Erklärvideo von zwei Minuten wirklich kostet
Rechne, bevor du einen Termin zusagst. Ein Film von zwei Minuten sind grob zwölf bis zwanzig Einstellungen, und jede braucht drei oder vier Generierungen, bis sie sitzt — plan also mit vierzig bis achtzig Durchläufen, nicht mit zwanzig. Entwirf in 480P, wo eine Iteration ein Viertel von einem Keeper kostet, und lass nur die Einstellungen noch einmal laufen, die es in den Schnitt geschafft haben. Ein fehlgeschlagener Durchlauf wird automatisch erstattet, der Sprechertext kostet nichts extra, und kommerzielle Nutzung ist in jedem kostenpflichtigen Tarif enthalten.
So wird abgerechnet
- Abgerechnet nach
- Ausgabesekunde
- Sprechertext
- ohne Aufpreis
- Dokument oder Link
- ohne Zuschlag
- Dein erster Clip
- kostenlos · 480P
Der ganze Film zuerst in 480P ist ein Storyboard, das man wirklich ansehen kann, und er kostet ein Viertel des fertigen. Alle Preise.
So oder so dieselben Credits pro Monat
So machst du ein KI-Erklärvideo
Einstellung für Einstellung
Vier Schritte, einmal pro Einstellung wiederholt. Der erste wird in einem Dokument geschrieben, nicht in diesem Generator — und ihn zu überspringen ist der Grund, warum die meisten Versuche bei Einstellung vier steckenbleiben.
Schreib die Einstellungsliste, bevor du irgendetwas generierst
Eine Zeile pro Einstellung: was im Bild ist, was gesagt wird, wie lang. Zwölf Zeilen für einen Film von zwei Minuten. Das ist der Teil, den das Werkzeug dir nicht abnehmen kann, und der Teil, der den Rest günstig macht.
Zuerst dasLeg einen Stilblock fest und nimm ihn wortgleich wieder
Palette, Objektiv, Licht, Oberflächen, Tonfall und „kein Text im Bild“. Füg denselben Block in jeden Prompt ein — er ist das Einzige, was zwanzig unabhängige Generierungen zusammenhält.
In jeden Prompt kopierenGenerier eine Einstellung, mit ihrer Zeile in Anführungszeichen
Der Sprechertext entsteht mit dem Bild, es gibt also nichts aufzunehmen und nichts zu synchronisieren. Schreib die Zeile in der Sprache, in der sie zu hören sein wird.
Stimme im selben DurchlaufEntwirf den ganzen Film in 480P, dann lass die Keeper neu laufen
Schneide die Entwürfe zusammen und sieh dir das Ganze von Anfang bis Ende an, bevor du etwas für Auflösung ausgibst. Die meisten Umschriften sind strukturell, und ein Storyboard in 480P findet sie für ein Viertel des Preises.
Bis zu 1080P
Die Zwei-Drittel-Regel aus den Unternehmensfilmen, die hier entstehen: Die Vorführung ist der Film. Auftakt und Abbinder sind günstig zu generieren und günstig zu schneiden — die Einstellungen, die die Freigabe verdienen, sind die, in denen die Sache tatsächlich getan wird.
Fragen zum KI-Erklärvideo
Ob es das Skript schreibt, wie die Stimme funktioniert, wie lange ein Film wirklich dauert und was du veröffentlichen darfst
Macht es aus einem Skript automatisch ein fertiges Erklärvideo?
Woher kommt die Sprecherstimme?
Darf der Sprechertext auf Japanisch, Chinesisch oder Koreanisch sein?
Wie verhindere ich, dass es wie Werbung aussieht?
Wie bringe ich zwanzig Einstellungen dazu, wie ein Film auszusehen?
Kann es eine Warnung zeigen, ohne den Unfall zu zeigen?
Was kostet ein Erklärvideo von zwei Minuten an Credits?
Darf ich das auf unserer Firmenseite veröffentlichen?
Muss ich offenlegen, dass das Erklärvideo mit KI gemacht wurde?
Schreib eine Einstellung. Hör sie in neunzig Sekunden zurück.
Bevor du einen Film budgetierst, generier seine schwerste Einstellung — die mit dem Zeichen, der Auflage und der Zeile, die stimmen muss. Erster Clip kostenlos in 480P, eine E-Mail und keine Karte. Stimmt der Tonfall nicht, weißt du es heute statt erst in der Abnahme.
Geschrieben und gepflegt von der Redaktion von wan-3.runVeröffentlicht am Zuletzt aktualisiert am Tool Version 2026.09.4
