Wan 3.0 テキストから動画
30 秒、音つきで
プロンプトを 1 つ入れれば、仕上がったクリップが出てきます — 間に編集ソフトはありません。Wan 3.0 のテキストから動画は 2 秒から 30 秒を 480P / 720P / 1080P で走らせ、セリフも効果音も音楽も、絵と同じファイルに書き込みます。1 本目は無料で、走るのは去年のモデルではなく本物です。
Wan 3.0 のテキストから動画のプロンプト 6 本と、それが生んだクリップ。続けてライブラリの残りも · 「これを試す」で読み込めます
12s · 16:9 · 720P逆光の霧の中のダンサー
Wan 3.0 のテキストから動画が実際に返すもの
Wan 3.0 のテキストから動画は、最大 20,000 文字の書かれたプロンプトを受け取り、2 秒から 30 秒・30 fps の MP4 を 1 本返します。解像度は 480P / 720P / 1080P。音声・効果音・音楽は同じ処理の中で生成されます。音声だけの別工程も、アップスケールの段もありません。
A woman walks down a street.
残りはモデルが埋めました
- 時刻は?
- 何を着ている?
- 光はどこから?
- カメラはどちらへ動く?
- どんな音がする?
- どう終わる?
Wan 3.0 · 16:9 · 720P · 5sあなたが答えなかった 6 つに、代わりに答えが付きました。モデルが意地悪をしているわけではありません — プロンプトは仕様書であり、開いたままの問いは Wan 3.0 が自分で閉じるしかないのです。その問いに答える余地こそが差になります。20,000 文字はどんなショットにも余るほどで、しかも音の指示は絵と同じ欄に書けます。
- 書ける文字数
- 20,000
- 整数秒なら自由
- 2〜30 秒
- どの段階でも
- 30 fps
- 解像度:480P · 720P · 1080P
- 3
- 絵と音を同時に
- 1 回の処理
書ける文字数
整数秒なら自由
どの段階でも
解像度:480P · 720P · 1080P
絵と音を同時に
- 元画像は不要
- 音声だけの別工程はなし
- アップスケールの段はなし
5 秒と 30 秒は
別の Wan 3.0 プロンプトです
最初に取り違えられるのがここです。短い Wan 3.0 のクリップは、1 つの動作を精密に書くことを求めます。長いクリップは、拍を順番に並べることを求めます — 最後の 3 分の 1 を書かずに残せば、モデルは好きなもので埋めます。下は長さごとに 1 本ずつ、実際のクリップ 3 本と、それを作ったプロンプトです。
5 秒
動作 1 つ

One subject, one action, one framing. Do not describe a change — there is no room to deliver one.
もつ
5 秒に 3 つの拍を書き込むと、モデルはいちばん強いものを選びます。1 つだけ頼めば、頼んだその 1 つが返ります。
12 秒
拍を、順番に

Two or three beats with the order stated. Then, after that, finally — connectives are the only scheduling grammar there is.
収まる
形が現れ、留まり、去るだけの長さはあります。物語が入るほどではありません — そして Wan 3.0 にタイムコードの文法はないので、順番は言葉で示すしかありません。
15 秒
拍と、終わり方

Give every beat one job and write the last one down. An unplanned final third is the most common way a long clip goes wrong.
着地する
拍は 4 つ。4 つ目は、モデルに終わり方を考えさせないためだけに存在します。
範囲は 2 秒から 30 秒、整数秒なら自由、一続きのテイクで。同じ秒数なら 480P の下書きは 1080P の 4 分の 1 なので、長さは 480P で見つけ、解像度は一度だけ払ってください。ここのプロンプトはすべてプロンプト例に全文が載っています。
アリババ自身の型で
Wan 3.0 のプロンプトを組む
欄を埋めると、プロンプトが組み上がっていきます。そのまま生成器へ送れます。
Wan 3.0 のプロンプトが取るべき形は、アリババが公開しています。主体、次に情景、次に動き、次に画づくりの指定、最後に様式化。音はその横に書く。たいていの解説では、この形は散文に言い換えられて消えます。ここの欄は形を保ちます — そして欄の名前はモデルに一切届きません。Wan 3.0 は平の段落を 1 つ読むだけで、ラベルらしきものは何でも画面に描いてしまうからです。
順番が効きます
言葉が入る場所
主体・情景・動き — 何が起きているか
画面にいるのは誰か何か、どこにいるか、何が動くか。
- 主体
- 情景
- 動き
その順で、普通の文として書いてください。主体は思い浮かぶ程度に具体的に、場所には時刻と光源を、動きは何がどれだけどの速さで動くかを。動かないことも答えのうちです — 触れなかったカメラは、モデルが自由に動かしていいカメラです。
画づくりの指定、様式化 — どう撮るか
サイズ、カメラの動き、レンズ、光 — 必要なら、そのあとに名前のついたルック。
- 画づくりの指定
- 様式化
画角、カメラの動き(大きさと速さつき)、レンズ、光を、カンマ区切りの一節に。様式化は最後で、任意です。ジャンル名は撮り方の文法をまるごと連れてくるので、3 語の様式化が 1 段落の説明に匹敵します。
音 — 同じ処理で
セリフ、効果音、環境音、音楽 — そして無音。
- 台詞
- 効果音
- 環境音
- 音楽
Wan 3.0 は音を絵と並行して書くので、これは後付けではなく音の指示書です。層ごとに名指しし、話す行は波かっこに入れ、聞きたくないものも書いてください — ネガティブプロンプト欄はないので、「音楽なし」は 1 つの文として書きます。
組み上がったプロンプト(実時間)
主体・情景・動き
A courier in a soaked yellow jacket shoulders open a door into a narrow alley at night, neon spilling across wet brick.
画づくりの指定、様式化
Mid shot, the camera pushes in slowly, a small move, 35mm, shallow depth of field, hard practical light.
音
Rain on fabric and asphalt, a door hinge, distant traffic. No music.
0 / 20000
この欄はこちらが組み立てる順序です。ラベルがモデルに届くことはありません。
Wan 3.0 はこれをどう扱うか
- 01平文の文字列 1 つ、最大 20,000 文字
- 02欄名も、ショット記号も、タイムコードもなし
- 03演じられるのは {そのままの台詞} のほう
- 04除外は専用欄ではなく、文として書く
- 05音声は同じ処理で、同じ料金で生成
そもそも自分で書きたくない? プロンプトジェネレーターが、一行の説明から全体を組み立てます。無料、回数の制限もなし。あるいはすでにクリップになったプロンプト 11 本から始めてください。
カメラの動きを名指しすれば、感じが出る
cinematic と書いても何も起きません — 実行できるものが中にないからです。Wan 3.0 が求めるのは動きで、その動きに大きさと速さが付いているほど、忠実に従います。
push in / pull out / tracking shot / arc shot / tilt up / pan across / static shot
a small move / a large move
slowly / quickly
こう動きます
slowly push in, a small move
cinematic camera work
実行できるものがない
starts with close-ups, then gently circles both players段取りではなく、並びです。starts with… then… がこの文法のすべて。
rising slowly from ground level as the machine stands動きが動作に結ばれているので、動作とずれようがありません。
a slow push in that stops before the centre dancer fills the frame時間ではなく終了条件を持つ動き。どちらよりも壊れにくい。
動きが起きる場所
指定した長さを超えた分 — モデルは伸ばすのではなく詰めます
指定した長さはここで終わります
Wan 3.0 にタイムコードの文法はありません。順番は接続表現 — then、after that、finally — から生まれます。そしてカメラの動きを段取りに乗せる最も確実な方法は、時刻ではなく動作に結び付けることです。動作に結ばれた動きは、ずれるのではなく、動作と一緒に詰まります。
すでに素材があって、書き直すより作り直したい? それがWan 3.0 の動画編集です。複数のクリップで同じ被写体を保ちたい? 参照素材から動画へ。
Wan 3.0 のプロンプトに
セリフと音を書き込む
Wan 3.0 は同じリクエストの中で、音声を絵と並行して生成します。つまりプロンプト欄はそのまま音の指示書でもあり、書いても書かなくても料金はまったく同じです。何も言わなくてもサウンドトラックは付いてきます。ただそれは、モデルが選んだものです。
話される一行の解剖
同じ処理 · 追加料金なし
音を 3 段階で書いた例 · 720P · 15s4 つの層を、それぞれ名指しで
4
- 台詞
- 効果音
- 環境音
- 音楽
見落とされる規則
ネガティブプロンプト欄はありません。除外はプロンプトの中に文として書きます。無音もそのひとつです — 「no music」と書けば音楽は付かず、何も書かなければ、その場面にふさわしいとモデルが判断したものが付きます。
no music, no voice-over正しいNegative prompt: music, voice-over誤り
ネガティブプロンプトの形をしたものは、描くべき文字列として読まれます。しかもリクエストは成功するので、失敗は「その文字が焼き込まれた仕上がりのクリップ」として届きます。
それを言う人物の写真から始めますか? リップシンクは、この同じ波かっこの作法の前にアップロード欄を置いたものです。複数のクリップで同じ顔、同じ声を保ちたい? 参照素材から動画を使ってください — 1 リクエストで画像 10 枚、動画 5 本、音声 5 本まで運べます。
Wan 3.0 テキストから動画の仕様と、
4 つの罠
このうち 2 つは、初めて踏んだときにお金がかかります。指定しないと解像度は高い方の段に落ちますし、縦横比が欠けているとリクエストはその場で失敗します。残りはアリババが公開している Wan 3.0 の数値で、それぞれ出典に紐づけてあります。


- 01プロンプトの長さ
- 2 万字上限を超えた入力は、拒否ではなく黙って切り詰められます
- 尺
- 2〜30 秒、整数秒1 回の処理で。30 秒を超えるなら、もう 1 本と編集ソフトが要ります
- フレームレート
- 30 fps
- 02解像度
- 480P · 720P · 1080P未指定なら 1080P — 明示してください
- 4K
- 非対応
- 縦横比
- adaptive, 16:9, 4:3, 1:1, 3:4, 9:16テキストから動画では具体的な比が必要です — adaptive には読み取る絵がありません
- 音声
- 同じ処理の中で生成オンでもオフでも料金は同じ
- シード
- 0〜2,147,483,647揺れの大半は固定されますが、すべてではありません
Source: Alibaba Cloud Model Studio · Wan 3.0 テキストから動画のリファレンス
つまずくのはこの 4 つ
- 01
解像度は、いちばん高い段が既定です。
- 480P
- 720P
- 1080P
- unset
指定を省くと、Wan 3.0 は 1080P で生成し、1080P で課金します。同じ秒数なら 4 分の 1 の 480P で下書きし、これという 1 本にだけ解像度を払ってください。
- 02
ネガティブプロンプト欄はありません。
- no music
- no on-screen text
- no camera shake
- negative_prompt
除外はプロンプトの中に文として書きます。ネガティブプロンプトの書式で書いたものは、描くべき文字列として届きます。しかもリクエストは 200 を返すので、その文字が入ったクリップに料金を払うことになります。
- 03
参照素材の番号は大文字小文字を区別します。
- Image 1
- Video 1
- Audio 1
- image1
大文字始まり、半角スペース、種類ごとにアップロード順で採番。小文字やアンダースコアは何にも結び付かず、モデルは黙って別の被写体を作ります。詳しくは参照素材から動画に。
- 04
スマート長さは料金を隠します。
- 3s
- 5s
- 15s
- 30s
- auto
長さをモデルに選ばせると、終わるまで料金が分かりません。本サイトは長さを明示して課金するので、ボタンに出ている数字がそのまま引かれる数字です。
Wan 3.0 テキストから動画のクリップにかかる料金
クレジットが引かれるのは、生成を押したときではなくクリップが返ってきたときです。失敗した生成は 0 円で、問い合わせなしに自動で返還されます。請求を動かすのは長さと解像度の 2 つだけ — 音声は動かしませんし、縦横比も、どのプランにいるかも動かしません。
5 秒のクリップ 1 本、クレジット換算
- 480P
- 40 クレジット
- 720P
- 80 クレジット
- 1080P
- 160 クレジット
段が上がるごとに倍。しかも Wan 3.0 は 1 秒目から計るので無料の下駄はなく、15 秒のクリップは隣の 5 秒の 3 倍です。実務的な回し方はこう:480P でショットを見つけ、これという 1 本だけ 1080P で回す。クレジット表の全体と、30 秒のクリップの料金。
どちらでも月々のクレジットは同じ
Wan 3.0 テキストから動画、3 ステップ
3 ステップ、編集ソフトなし、音声のための 2 度目の処理もなし。音が絵と同じファイルに入っているのは、Wan 3.0 が両方を一緒に作ったからです。
ショットと音を書く
欄 1 つで両方を受け取ります。空欄が問題なら上のビルダーを使ってください。そして形容詞に手を伸ばす前に、カメラの動きを 1 つ名指ししてください — モデルが応えるのは雰囲気ではなく動きです。
最大 20,000 文字長さと解像度を決める
2 秒から 30 秒の整数秒。下書きは 480P で。試している画角にそれ以上は要りませんし、どの段でも同じ Wan 3.0 です — 解像度で買えるのは画素であって、より良いモデルではありません。
2〜30 秒 · 480P / 720P / 1080PMP4 をダウンロード
音声はもう混ざっています。あとから書き出すものも、開くものもありません。
1 ファイル、音声込み
短いクリップで 90 秒ほど。1080P の 30 秒はもっとかかります。走っているあいだタブを閉じても構いません — 戻ってくれば結果が待っていますし、失敗した生成は自分で返還されます。
Wan 3.0 テキストから動画についての質問
Wan 3.0 のテキストから動画がプロンプトから何を読み、書かなかったところに何を足し、1 回いくらかかるか
Wan 3.0 のテキストから動画とは何ですか
Wan 3.0 のテキストから動画を試すには会員登録が必要ですか
Wan 3.0 のテキストから動画のクリップはどれくらいの長さにできますか
Wan 3.0 のプロンプトはどれくらい長く書けますか
Wan 3.0 のテキストから動画は音も作りますか
Wan 3.0 にネガティブプロンプトはありますか
台詞はどう書きますか?
Wan 3.0 のテキストから動画で 4K は出せますか
クリップがプロンプトの一部を無視したのはなぜですか
生成が失敗したらどうなりますか
一文あれば、確かめられます。
1 本目はこちら持ちです — Wan 3.0 そのものを 480P、最長 3 秒、音つきで。思っていたものと違った? 費用は 0 円ですし、ビルダーは 1 画面上でまだ開いていますし、ここでは失敗した生成に請求が立つことはありません。
wan-3.run 編集チームが執筆・管理しています公開 最終更新 ツール バージョン 2026.09.4
