Wan 3.0 参照素材から動画
顔、ジャケット、商品、声をアップロードしてください — Wan 3.0 はその 4 つすべてを受け取り、存在しなかった場面の中で、最長 30 秒のあいだ 1 つも変えずに保ちます。1 回の生成で画像 10 枚、動画 5 本、音声 5 本まで。
公開されている Wan 3.0 の生成 3 本と、続けて本サイトの他のアイデアすべて · 「これを試す」でプロンプトを読み込みます
16:9 · 720P · 5sImage 1 を名指しして、固定する
Wan 3.0 の参照素材から動画が
変えずに保つもの
素材をアップロードすると、Wan 3.0 はそれに従う場面を組み立てます。
Wan 3.0 の参照素材から動画は、最大 20 点のリファレンス — 画像 10 枚、動画 5 本、音声 5 本 — を受け取り、そのひとつひとつを出発点ではなく制約として扱います。顔、衣類、小道具、声、空間の位置関係は、最長 30 秒の 1 テイクを通して保たれ、音声は同じ処理の中で生成されます。
- 画像 · 動画 · 音声
- 10 + 5 + 5
- 1 リクエストに入る点数
- 20
- 整数秒なら自由
- 2〜30 秒
- 30 fps、音声込み
- 480P / 720P / 1080P
画像 · 動画 · 音声
1 リクエストに入る点数
整数秒なら自由
30 fps、音声込み
- 編集ソフトではありません — 既存のものを直すのではなく、新しい場面を組み立てます
- 顔の差し替えではありませんし、同意のない人を動画に登場させる手段でもありません
- リファレンスと先頭フレームの併用は不可 — この二族は互いを排除します
Wan 3.0 がリファレンスと先頭フレームを同時に受け取らない理由
Wan 3.0 のメディア入力は 2 つの系統に分かれていて、1 回のリクエストで使えるのはどちらか一方だけです。
reference_image参照族このページreference_image·reference_video·reference_audio·file·link— 存在しなかった場面を組み立てるために、モデルが借りてくる素材です。
first_frameフレーム族画像から動画first_frame·last_frame— 出力が必ず通らなければならない、正確な冒頭と、必要なら正確な終端です。
両方の系統から 1 つずつ送ると、Wan 3.0 はどちらかを選ぶのではなくリクエストごと拒否します — このページがリファレンスを足した瞬間にフレーム入力を無効にするのはそのためです。拒否はアリババ側、しかも待ち行列に並んだ後で起きるので、ここで捕まえれば待ち行列の 1 枠ではなく 1 秒で済みます。
どちらの系統が要るかは、あなたの問いの立て方から決まります。「まさにこの写真から始めたい」はフレームで、それは画像から動画です。「この顔のまま、行ったことのない場所へ」はリファレンスで、それがこのページです。ショット間ではなく 1 本のクリップの中で崩れるなら、リファレンスの束は解になりません。キャラクター一貫性の方です。
Wan 3.0 が受け取る
リファレンスの数
Wan 3.0 に入る素材は 3 種類で、それぞれに上限があります:画像 10 枚、動画 5 本、音声 5 本。
⚠️ Wan 3.0 はリファレンス動画の秒数を出力秒数と並べて課金し、その合計は 30 秒を超えられません。 リファレンス 6 秒+出力 20 秒なら課金 26 秒で、有効なリクエストです。6 秒+28 秒は通りません。画像・音声・資料・リンクは何も足しません。
動画の枠は 5 つで 1 本 15 秒なら 75 秒になりますが、上限は 15 秒です — つまり動画では枠の数が効くことはなく、効くのは走行合計の方です。プロンプト欄の上のカウンターが、生成を押す前に、秒数とクレジットの両方で追いかけます。
Wan 3.0 が実際に保つもの
アリババは Wan 3.0 の一貫性を 4 つの軸で挙げています。別々に知っておく価値があります。何かがぶれるとき、たいてい 4 つ全部ではなくそのうちの 1 つだからです。
被写体
カメラが向いている先。
characters人物
顔立ち、髪型と髪色、体つき、服、小物。
ジャケットのストラップが立ち回りを生き延びる程度には細かく。
props小道具
多方向から見た形、金具の構造、ロゴ、素材の質感。
同じボトルが、ショットをまたいでラベルごと保たれます。
場面
被写体のまわりのすべて。
space空間
人物の立ち位置とカメラの視点。空間の位置関係が正しく保たれます。
ショット間で地理がずれなくなります。
styleスタイル
映像のトーンが一貫して描かれ、複数スタイルの企画でもルック同士がにじみません。
セット全体で 1 つのグレーディング。
アリババ自身の Wan 3.0 のショーケースは、リファレンス画像 2 枚を高速アクションの 30 秒に通し、毛並み・服・鞘・立ち位置を最後まで保っています。それが上限で、あなたの結果はほとんどリファレンスの質で決まります。
実務の多くは 1 本の長いテイクではなく、同じ制作に見えなければならない 3〜4 本のクリップです。その方法は、言葉にすると退屈です:プロンプト以外のすべてを同一に保つ。同じファイルをバイト単位で、素材ごとの役割も同じに、末尾のスタイルの一文も同じに、解像度も縦横比も同じに。変えるのは動作とカメラだけ。同じ写真を軽く書き出し直したコピーを上げ直すのが、並びがぶれるいつもの原因です。ファイルがもう同一ではないからです — Wan 3.0 はリクエスト間に記憶を持たないので、一貫性は渡したものだけで決まります。
Wan 3.0 のリファレンスには、1 つずつ役割を与える
結果が正しく見えるかどうかを決めるのがここで、Wan 3.0 の試みが失敗するのもたいていここです。モデルは、あなたがそのファイルを何のために上げたのかを推測しません — プロンプトの中で、番号で伝えます。
顔と衣装を固定するWan 3.0 がいちばん得意なことです。1 枚に 1 人、正面から、光の回ったものが、芸術的なものより毎回勝ちます — 証明写真のような 1 枚が、雰囲気のあるポートレートを上回ります。
Image 1 is the woman in the grey wool coat; keep her face, hair and coat exactly.
商品や小道具を固定する多方向から見た形、ロゴ、金具、素材のすべてが保たれます。1 枚の決めカットより、同じ物体を 2 方向から撮った方が効きます。
Image 2 and Image 3 are the same bottle; keep the label and the cap hardware.
動きと間を提供するリファレンスのクリップは、真似されるためにあるのではありません。そのリズム — 拍がどれだけ保たれるか、遷移がどう動くか — を提供するためにあります。
Video 1 donates the walking cadence only, not the character.
声を提供する、あるいは空間を決める音声のリファレンスは音色を決め、顔のリファレンスと組めば口の動きもそれに従います。ロケーションの 1 枚は立ち位置とカメラの視点を固定し、地理がずれなくなります。
Audio 1 donates timbre only. Image 4 sets the room and the camera height.
image1 ではなく Image 1 と書く
Image 1 · Video 1 · Audio 1Wan 3.0@image1Seedance
Wan 3.0 が期待するのは、大文字始まり・半角スペースの英語表記です。@image1 は Seedance の書式で、いくつもの解説がここでもそう書いていますが、ここでは読まれません。採番はメディアの種類ごとに独立していて、アップロード順に従います — ファイルの順番を入れ替えれば、それは別のリクエストです。
20 点は見出しの数字であって、実際に使うべき数はもっと小さい。1 枚に 1 被写体、1 素材に 1 役割 — 1 つのファイルが矛盾する 2 つの役割を背負った瞬間、あるいは 1 枚に 2 人が写った瞬間、モデルは推測するしかなくなります。その推測を防ぐためにリファレンスを上げたはずです。うまくいく場面のほとんどは 3〜4 点で済みます。残りのプロンプトは書きたくない? プロンプトジェネレーターが、アリババの順序で書きます。
Wan 3.0 の一貫性が崩れるとき、どうするか
リファレンスモードは、入力にも課金される唯一の Wan 3.0 の経路です。だから外れて返ってくると、費用は二重になります。以下は崩れ方 5 つを、出会いやすい順に並べたものです。生成ボタンの上のパネルは、事前に見えるものについてあなたの設定を読みます。
人物がリファレンスに似ていない
ほとんどの場合、その画像に 2 人以上写っているか、同じ画像に場所やスタイルの定義まで頼んでいるかです。
1 枚に 1 被写体、1 素材に 1 役割。
2 人が触れるところで混ざる
位置が重なり、しかも同時に動くのがいちばん難しい場面です。まず離れているショットで確かめ、そこから接触を足してください。
十分に離れた 2 人なら頼れます。触れ合う群衆は頼れません。
動きがリファレンスのクリップを無視する
その素材に人物の定義まで頼んでいるので、役割を 2 つ背負っていて、モデルはどちらかを選ぶしかありません。
役割 1 つずつの 2 素材に分けてください。
請求が思ったより大きい
リファレンス動画の秒数は出力と同じ料率で課金され、同じ 30 秒の上限に含まれます。画像・音声・資料・リンクは無料です。
リファレンス 6 秒 + 出力 20 秒 = 課金 26 秒。
生成に入る前に拒否される
リファレンスと一緒に先頭フレームが送られています。この二族は互いを排除し、拒否されるのは入力 1 つではなくリクエスト全体です。
順番:Image 1 · Image 2 · Video 1 — フレーム入力なし。
まず単純なところから始めてリファレンスの質を確かめ、そこから複雑にしてください。5 人で失敗する場面が 2 人なら通ることはよくありますし、きれいな 2 本をつないだ方が、濁った 1 本より良く見えます。
Wan 3.0 参照素材から動画のクリップにかかる料金
秒あたりの料率は他のモードと同じで、リファレンス自体に追加料金はありません。唯一の例外がリファレンス動画で、その秒数はあなたの出力と同じ料率で課金されます。 画像・音声・資料・リンクは何も足しません。他と同じく、失敗した生成は自動で返還されるので、外した生成が奪うのは待ち時間だけです。
課金のされ方
- 課金の単位
- 出力 1 秒
- リファレンス画像 · 音声 · 資料 · リンク
- free
- リファレンス動画
- 出力と同じ料率で課金
- 失敗した生成
- refunded
- リファレンス画像 · 音声 · 資料 · リンク
- 追加料金なし
リファレンス動画は、このページにあって他のツールにはない 3 つ目の変数です。15 秒のリファレンスを 15 秒の出力に付ければ、課金は 15 秒ではなく 30 秒です。480P で下書きし、これという 1 本だけを回してください。料金の全体
どちらでも月々のクレジットは同じ
実在する人物の肖像を使う
Wan 3.0 の参照素材から動画は、テイク全体を通して顔を保ちます。それが機能であり、同時に悪用を容易にするものでもあるので、ここでの規則は短いです:他人の肖像は、その人の同意があるときだけアップロードしてください。
- 顔実在する人物の動画には本人の同意が要ります。公人も、見知らぬ人の写真も対象外です。
- 声音色のリファレンスは、特定の人の声の響きを複製します。自分の声か、許諾のあるものか、合成音を使ってください。
- キャラクター著作権のあるキャラクターは、モデルが描き直したからといってあなたのものにはなりません。
- 未成年未成年が写ったリファレンスは、絶対にアップロードしないでください。
- モデレーション送られたメディアは自動で検査され、通報は人が見る受信箱に届き、削除はいずれではなく速やかに処理されます。誤検知も見落としも起こります。
Wan 3.0 参照素材から動画についての質問
Wan 3.0 の参照素材から動画がテイクを通して何を保つのか、そしてリファレンスの秒数が請求に何を足すのか
Wan 3.0 の参照素材から動画を試すには会員登録が必要ですか
Wan 3.0 はリファレンス画像を何枚まで受け取りますか
Wan 3.0 のリファレンス画像と先頭フレームは一緒に使えますか
人物が Wan 3.0 のリファレンスと違って見えるのはなぜですか
リファレンス動画を使うと Wan 3.0 のクリップは高くなりますか
Wan 3.0 は顔だけでなく声も一貫させられますか
1 つの Wan 3.0 のショットに何人まで入れられますか
リファレンスは Wan 3.0 の別々の生成に引き継がれますか
リファレンスに使える形式は何ですか
作った動画を商用利用できますか?
最初の Wan 3.0 の場面を配役する
顔を 1 つアップロードし、役割を 1 つ与え、ショットを書いてください。Wan 3.0 の参照素材から動画は 480P からクレジットで動きます — あなたの素材に追加料金はかからず、失敗した生成は自動で返還されます。
wan-3.run 編集チームが執筆・管理しています公開 最終更新 ツール バージョン 2026.09.4
