Wan 3.0 リップシンク動画

顔を放り込んで台詞を引用符で書けば、口が言葉についてきます。Wan 3.0 のリップシンクは音声を絵と同じパスで生成するので、先に録る音声ファイルも、あとから当てる吹き替えのパスも要りません。2 秒から 30 秒、音は MP4 の中に、そして最初の 1 本は料金がかかりません。

話し手

画像を作成

JPG · PNG · BMP · WEBP · ≤20MB · 240–8000px · 比率 ≤8:1

0 / 20000

話し手は最後まで同じ顔・髪・服装・色を保ちます。変わるのはカメラと、記述された動きだけです。

Model
Aspect ratio
Duration
Resolution
無料で会員登録 · Wan 3.0 のクリップ 1 本

無料クリップは音声つきの同じ Wan 3.0 で、上限は 480P · 3s、共有の順番待ちに入ります。プランで上限が上がり、1080P と 30 秒になります — 無料ティアは解像度であって、別のモデルではありません。

本物のモデルで 1 本無料 · メールのみ、カード不要 · 音をオンにしても、オフのままでも料金は同じ

アリババ自身の Wan 3.0 セリフデモ · 「試す」でプロンプトが読み込まれます

キッチンカウンターでピンクのポータブルブレンダーを持ち、カメラにまっすぐ話しかける女性カメラに向かって · 9:16 · 720P

カメラに向かって、台詞 6 つぶん

返ってくるもの

プロンプトに 台詞が入っているとき、Wan 3.0 は何をするか

ここにあるクリップはすべてアリババが Wan 3.0 のために公開したデモで、どれも生成したプロンプト付きで公開されました。聴くで音声を、プロンプトを使うでこのページ上部の入力欄に丸ごと読み込めます — 書かれた言語のまま、省略なしで載せています。

  • 1 パス絵、発話、口の動きが 1 回の生成の中に
  • $0音声トラックの追加料金
  • wan3.0-videoこの帯のすべてのクリップを作ったモデル
  • キッチンカウンターでピンクのポータブルブレンダーを持ち、カメラにまっすぐ話しかける女性リファレンス
    カメラに向かって 6 つの台詞、商品はリファレンス画像に固定
  • 夜の屋上ステージ中央に立つ歌手、その後方に DJ、さらに奥に街のスカイラインリファレンス
    言語を切り替え続ける歌手 1 人、同期は 8 言語すべてで保たれています
  • 陽の差す木造の道場に立つ、灰色のロングコートとゴーグルの男性リファレンス
    話し手 2 人、日本語、1 人 1 台詞、かぶりなし
  • ModelTalk のネオンサインの下、ヘッドホンを着けてポッドキャストのマイクに向かう茶トラ猫とゴールデンレトリバー先頭フレーム
    動物 2 匹の静止画が、10 往復の会話になります

台詞が決まるかどうかを分けるもの

  • 言葉

    台詞そのものを引用してください。言い換えると、モデルが作った台詞が返ってきます。

  • 話し手

    誰が話すかを固定 — 年齢、髪、服装。でないと違う口が動きます。

  • カメラ

    台詞のあいだは顔に寄せたままにしてください。

  • 文字

    字幕なしで締めてください。でないと台詞が画面に印字されて返ることがあります。

テキストプロンプトから

かんたんなテキストプロンプトから AI リップシンク動画を生成

台本の書式も、タイムラインも、音声ファイルも要りません。ふつうの文でショットを説明し、キャラクターが言う言葉を引用符で書いて画面の人物に紐づければ、Wan 3.0 が 1 リクエストの中で絵を生成し、音声を合成し、口をそれに合わせて動かします。

プロンプト 1 本、台詞 1 つ

Medium A-roll. The woman stands behind the kitchen counter
holding the pink portable blender, speaking naturally to camera.
She says: "I get asked how I make smoothies so quickly."
No subtitles, no text overlays, no UI, no watermark.

  • ショット、カメラ、そして誰が話しているか
  • 引用された台詞と、印字してほしくないもの
2484 / 20,000

1 パスで出てくるもの

キッチンカウンターでピンクのポータブルブレンダーを持ち、カメラにまっすぐ話しかける女性9:16 · 720P · 30S

wan3.0-video · 16:9 · 720P · 14 秒 · 発話と口の動きが同じパスで

上の 4 行はアリババ自身の 30 秒デモから抜いたもので、そのプロンプトは 20,000 文字の上限に対して 2,484 文字です。余白は話し手と商品と除外事項を固定するためにあり、長く書くためではありません。 ポートレートをアップロードするか文章で描写するかで、台詞そのものの書き方は何も変わりません。

クレジットを使う前に

リップシンク動画のプロンプトを AI でよくする

外して返ってきた生成は、まずモデルの問題ではありません。絵は名指ししたのに、言い回し・カメラ・字幕の扱いを運任せにしたプロンプトです。

プロンプトジェネレーターは、言わせたい台詞を受け取って、その周りに完成した Wan 3.0 のプロンプトを返します — 話し手を固定し、カメラの動きを 1 つ名指しし、音のレイヤーに順位をつけ、台詞をナレーションではなく演技として読ませるために区切ってあります。結果はこのモデルが実際に強制する規則と照合されるので、人が忘れがちな一文は、クレジットを使ったあとではなく使う前に足されます。

  1. 01

    言わせたい台詞を打つ

    始めるには 1 文で十分です。誰がどこで言うかは断片でかまいません。

  2. 02

    その周りにプロンプトを組んでもらう

    話し手、カメラ、音のレイヤー、区切った台詞を、Wan 3.0 が読む順番で。

  3. 03

    ここへ送って顔を足す

    プロンプトはこのページ上部の入力欄に、尺と比率をすでに設定した状態で届きます。

プロンプトジェネレーターを開く

言い回しが気に入ったクリップがすでにありますか? 動画からプロンプトが話された台詞を書き起こし、波かっこに入れて返します — このモデルがナレーションではなく演技として扱う形です。

端から端まで

台本から動画までの、ひと続きの AI ワークフロー

同じエンドポイントへの入口が 4 つ。手元にあるのが台本の一段落でも、企画書でも、ポートレートでも、すでに生成したクリップでも、そこからしゃべるテイクまでの道があります。どれにも、別の音声ツールを後付けする必要はありません。

  • 賑やかな街の広場のテーブルでチェスを指す若い男性と年配の女性

    台本 → プロンプト

    台詞を渡すと、その周りに組み立てたショット記述が返ってきます。話し手は固定され、台詞はすでにその人物に紐づいています。

    無料 · クレジット不要
  • 開けた高速道路を走る長距離トラックが、歩く機械へと展開していく

    企画書やページ → 台本

    PDF や公開 URL が、スライドをアバターに読ませたものではなく、ショットを組み立てる物語そのものになります。

    50 ページ · 100 MB
  • タイル張りのオフィスの洗面所にいるスーツ姿の男性 2 人、片方が台詞の途中

    ポートレート + 台詞 → しゃべるテイク

    顔が 1 フレーム目として入り、台詞が引用符付きで紐づけられて入り、口がそれについていきます。

    2〜30 秒 · 1080P まで
  • ショッピングアトリウムのワイド、エレベーター内、クローズアップにわたって保たれる同じ赤毛の女性

    同じテイクで、新しい台詞

    既存のクリップが何を言うかを、撮り直さずに変えます。話し手も、間も、画角もそのままで、口の動きだけが生成し直されます。

    すでに手元にある映像

上のすべては同じ場所に着きます — マイ作品が、どの生成についても MP4・プロンプト・タスク ID を保管するので、気に入ったテイクは組み立て直すのではなく開き直せます。

手順の全体

Wan 3.0写真にリップシンクさせる手順

人が間違えるのは 3 つ目です。モデルにはもう見えている絵を説明してしまい、モデルには推測できない言葉のほうを書かない。

  1. 顔を放り込む

    チェックはブラウザ内で即座に走ります。良いファイルは緑の行、悪いファイルは何も使う前に直し方を教えてくれます。

    チェックは無料
  2. 台詞を引用し、誰が言うかを書く

    そのままの言葉を引用符で、画面の人物に紐づけて。言い換え —「彼女が何か安心させることを言う」— では、モデルが作った台詞が返ってきます。

    そのままの言葉だけ
  3. 「字幕なし」で締める

    ネガティブプロンプトの欄はないので、台詞を印字するなという指示もほかと同じ 1 文です。一節で済み、生成 1 回ぶんを救います。

    一節
  4. 尺と解像度を決めて、生成

    台詞に必要な秒数を先に買ってください。発話・部屋鳴り・口の動きがすでに入った MP4 が 1 本返ってきます。

    1080P まで

短いクリップで 90 秒ほど。走っているあいだタブを閉じてかまいません。アップロードした写真が変更されることはありません — 出力は新しいファイルです。

ここでのリップシンクとは

あなたの写真が 1 フレーム目です。音声はアップロードするのではなく、書きます。

このカテゴリのたいていの道具は、画像と音声ファイルを取って口をそれに合わせます。これは画像と 1 つの文を取ります。

Wan 3.0 リップシンククリップの冒頭フレームに使われたポートレート

フレーム 001 · あなたの顔

ここから先は、しゃべって、同期して

Wan 3.0 のリップシンクは、あなたの写真を文字どおりの先頭フレームとして入れ、そこから 30 fps・480P / 720P / 1080P で 2〜30 秒を前へ生成します。引用した言葉は、そのクリップ自身の音声トラックに発話として返り、口はそれに合わせて動きます。絵と音が 2 回に分けて縫い合わされるのではなく、同じパスで生成されるからです。

あなたの写真が 1 フレーム目
001

あなたの写真が 1 フレーム目

用意すべき音声ファイルの数
0

用意すべき音声ファイルの数

任意の整数秒
2〜30 秒

任意の整数秒

返ってくる MP4。音はすでに中に
1

返ってくる MP4。音はすでに中に

  • 生成前のテキスト読み上げ工程なし
  • 生成後の吹き替えパスなし
  • 口のために別のモデルをライセンスする必要なし

台詞

台詞がしゃべられるか、画面に印字されるかを決めるもの

2 つの文が、台詞が聞こえるか読まれるかを決めます。片方はそのままの言葉を話し手の口に入れ、もう片方はそれを絵の上から遠ざけます。どちらかを落とすと、失敗は完成した課金済みの動画として届きます。

同期する台詞の解剖図

発話と絵 · 1 パス

…speaking naturally to camera. She says:"It blends everything smooth."

Realistic kitchen ambience, blending motor, casual room tone.No subtitles, no text overlays.

ModelTalk のネオンサインの下、ヘッドホンを着けてポッドキャストのマイクに向かう茶トラ猫とゴールデンレトリバー10 往復 · 720P · 30 秒
話し手 2 人、10 往復、しかも口を開けるのは話している側だけ — 押すと音が出ます

口が決まるために要るもの

3

  • 要約ではなく引用された、そのままの言葉
  • 固定できるだけ具体的に書かれた話し手
  • 話しているあいだ、その顔に向いたカメラ

人が見落とす規則

ネガティブプロンプトの欄はないので、「これを印字するな」もほかと同じくプロンプトの中の 1 文です。落とせばモデルは、あなたの台詞を**しゃべるものであると同時に画面に描くもの**として扱ってよいことになります。上に全文を載せたアリババ自身の 30 秒デモが、まさにその指示で終わっているのはそのためです。

  • no subtitles, no text overlays
  • Negative prompt: subtitles

ネガティブプロンプトの形をしたものは**描くべき言葉が増えた**と読まれ、しかもリクエストは成功します — なので失敗は、画面のどこかに「ネガティブプロンプト」という文字が入った完成クリップとして届きます。

波かっこでも働きます — {like this} はこのサイトのプロンプトツールが出す形で、上の壁にある洗面所のクリップもそれで生成されています。モデルが実際に探しているのは話し手が見える形で紐づいた、区切られた台詞で、アリババの公開プロンプトは引用符を使っています。テキストから動画が、4 つの音のレイヤーと名指しする順番を扱っています。

使う前に

クレジットを使う前にポートレートを確認

Wan 3.0 が読めない顔は、生成を失う一番いらだたしい形です。待ち行列の前ではなく、あとで分かるからです。ここに写真をドロップすれば、本物の上限 — 形式、サイズ、寸法、比率、透過 — と照合され、落ちた行ごとに直し方が示されます。何もアップロードされません。チェックはブラウザ内で走ります。

JPG · JPEG · PNG · BMP · WEBP · ≤20.0 MB · 2408,000px · ratio ≤8:1

顔 1 つ、しかも口が画面でいちばん小さいものにならない画角なら、同期に使える手がかりが最大になります。チェッカーはモデルに一切触れないので、どのみち読まれなかったポートレートを見つけるのに費用はかかりません。

入るもの

Wan 3.0 リップシンクの上限 — ポートレート、クリップ、音声

このうち 5 行は写真を、2 行は出てくるものを規定し、最後の 1 行が誰も予想しない拒否を生みます。このページ上部のアップロード欄が、画像の行を使う前に確認します。

固定した先頭フレームと音声の録音は、一緒に旅できません。 フレームは入力の一族、リファレンスはもう一族で、両方を持つリクエストは格下げではなくその場で拒否されます。だから選択はアップロードの前に起きます。

ポートレートの形式
JPEG · JPG · PNG · BMP · WEBPHEIC は拒否 — iPhone の既定の容器はリストにありません
公式
ポートレートのサイズ
≤ 20 MB
公式
寸法
各辺 240 – 8,000 px
公式
縦横比
8:1 – 1:8上限ではなく範囲 — 1:9 の縦長は 9:1 のバナーと同じように拒否されます
公式
透過
受け付けませんPNG のアルファチャンネルは統合されるのではなく拒否されます
公式
クリップの長さ
30 fps で 2 – 30 秒480P・720P・1080P で、任意の整数秒
公式
音声リファレンス
5 本 · 合計 ≤ 15 秒WAV または MP3、各 15 MB まで、1 本 1〜15 秒
公式
フレームとリファレンス
排他
公式

台詞そのものに専用の欄も専用の上限もありません。ほかのすべてと一緒にプロンプトの中に住み、プロンプトは 20,000 文字を抱えます。話される台詞を縛るのは文字数ではなく時計です — 短い 1 文につき画面上でおよそ 2〜3 秒なので、15 語の台詞を 4 秒のクリップに入れれば、早口になるか途中で切れるかです。解像度を買う前に、台詞に必要な秒数を買ってください。

料金 · 全ての有料プランで 1080P · ネイティブ音声

Wan 3.0 リップシンク 1 本の費用

値段を決めるのは尺と解像度です。発話は決めません:音声のスイッチが変えるのは返ってくるものであって、値段ではありませんし、音声リファレンスはそもそも課金されません。失敗した生成は自動で返金されますし、上のチェッカーが避けられる失敗のほとんどを、そもそもモデルに近づけません。

課金のされ方

課金単位
出力 1 秒
発話、音声リファレンス
課金なし
最初の 1 本
無料 · 480P

言い回しが決まるまで 480P で下書きし、それから 720P か 1080P で 1 回だけ使ってください — 生成のあいだにポートレートを確認し直す必要はありません。料金の全体

どちらでも月々のクレジットは同じ

  • 初回 1 本無料カード不要

    本物の wan3.0-video で 1 回だけ生成できます。自分のショットで Wan 3.0 が何をするか見てください — 480P、3 秒、音声も同じ処理で。

    $01 回のみ

    最後までカードは不要

    無料でクリップを生成

    メールアドレスだけ、カード不要

    1 本だけ、1 回だけ

    480P · 3 秒まで · 音声つき
    メールアドレスだけ、カード不要

    有料プランでアリババが動かしているのと同じ `wan3.0-video` です — 480P は解像度であって、劣ったモデルではありません

    • 2.7 ではなく、本物の wan3.0-video
    • 音声は映像と一緒に生成
    • 証跡にモデル ID とタスク ID
    • 失敗した生成で請求はされません
    • 720P と 1080P有料
    • 3 秒を超えるクリップ有料
    • 参照・資料・編集の各モード有料
    • 2 本目以降有料

    答えが出る問いはひとつ、Wan 3.0 があなたの案をどう扱うか。1080P も 30 秒もすべての入力モードも、$12.90 から始まります。

    ひと目で

    月あたりのクリップ
    1 本、1 回だけ
    1 回あたりのテイク
    1
    最長の尺
    3s
    最高解像度
    480P
  • Starter最大 20% お得

    週に 1 本のローンチ投稿ぶん。Wan 3.0 動画生成AI が自分の作り方に合うかを、量の判断を先送りしたまま確かめられます。

    $12.90/ 月$15.90

    年額 $154.80 のお支払い

    いつでも解約

    月 640 クレジット · ≈ 16 本

    5 秒 480P の場合 · 720P なら 8 本 · 1080P なら 4 本

    プランのクレジットは月末で失効します

    • 月 640 クレジット — 完成 16 本ほど
    • 1 回の生成で同じプロンプトから 2 テイク
    • 解像度はすべて — 480P・720P・1080P
    • 尺もすべて — 2〜30 秒を一発で
    • 入力もすべて — テキスト、画像、参照素材、資料、Web ページ
    • 音声は同じ処理で、透かしなし
    • 商用利用込み — 公開、販売、クライアントへの請求に使えます
    • 高速ティアの Wan 3.0 Prime を、使いたいときに
    • 失敗した生成でクレジットは減りません
    • クレジットが未使用なら 7 日間返金
    • 解約は 2 クリック — 加入時の価格は据え置きです

    上 2 行より下はすべて、$12.90 のこのプランに入っています。上位プランが買うのは秒数とテイクで、モデルが良くなることはありません。

    ひと目で

    月あたりのクリップ
    5 秒 480P で ≈ 12 本
    1 回あたりのテイク
    2
    1 ドルあたりのクレジット
    基準
    返金期間
    7 日間
  • だいたいここに落ち着きます
    Pro

    平日 1 日 1 本の完成品、それぞれ別案が 3 つ。480P で下書きして 1080P で仕上げるループを、1 週間ぶんの大きさで。

    $39.90/ 月$49.90

    年額 $478.80 のお支払い

    いつでも解約

    月 2,240 クレジット · ≈ 56 本

    5 秒 480P の場合 · 720P なら 28 本 · 1080P なら 14 本

    プランのクレジットは月末で失効します

    • 月 2,240 クレジット — Starter の 3.5 倍
    • 月 ≈ 56 本の完成品、1080P フルなら 14 本
    • 1 回の生成で同じプロンプトから 4 テイク — 撮り直さず、選ぶテイク 2 倍
    • Starter より 1 ドルあたり 13% 多い単価が良い
    • 同じ週のうちに 480P で下書きし 1080P で仕上げられる余裕
    • 解像度はすべて — 480P・720P・1080P
    • 尺もすべて — 2〜30 秒を一発で
    • 入力もすべて — テキスト、画像、参照素材、資料、Web ページ
    • 音声は同じ処理で、透かしなし
    • 商用利用込み — 公開、販売、クライアントへの請求に使えます
    • 高速ティアの Wan 3.0 Prime を、使いたいときに
    • 失敗した生成でクレジットは減りません
    • クレジットが未使用なら 7 日間返金
    • 解約は 2 クリック — 加入時の価格は据え置きです

    Starter からの差は、量とテイクと単価です。モデルも解像度も 30 秒も、すでにあなたのものでした。

    ひと目で

    月あたりのクリップ
    5 秒 480P で ≈ 44 本
    1 回あたりのテイク
    4
    1 ドルあたりのクレジット
    Starter 比 +21%
    返金期間
    7 日間
  • Studio最良の単価

    クライアント案件の物量と、1080P を出し惜しみしなくなる段。月 31 本のフル解像度の完成品を、本サイトで最も安いクレジット単価で。

    $99.90/ 月$119.90

    年額 $1,198.80 のお支払い

    いつでも解約

    月 6,240 クレジット · ≈ 156 本

    5 秒 480P の場合 · 720P なら 78 本 · 1080P なら 39 本

    プランのクレジットは月末で失効します

    • 月 6,240 クレジット — Starter の 9.75 倍、Pro の 2.8 倍13×
    • 月 ≈ 156 本の完成品、あるいは 1080P フルで 39 本
    • 1 ドルあたり 26% 多い — 本サイトで最良の単価最良の単価
    • 先に 480P で下書きしなくて済むだけの 1080P
    • 1 回の生成で同じプロンプトから 4 テイク
    • 1 チャンネルではなく、クライアント一覧を回す規模
    • プランを変えずに、どの月でも補充できます
    • 解像度はすべて — 480P・720P・1080P
    • 尺もすべて — 2〜30 秒を一発で
    • 入力もすべて — テキスト、画像、参照素材、資料、Web ページ
    • 音声は同じ処理で、透かしなし
    • 商用利用込み — 公開、販売、クライアントへの請求に使えます
    • 高速ティアの Wan 3.0 Prime を、使いたいときに
    • 失敗した生成でクレジットは減りません
    • クレジットが未使用なら 7 日間返金
    • 解約は 2 クリック — 加入時の価格は据え置きです

    1 チャンネルではなくクライアント一覧のためのプランです。どのプロンプトも 4 テイク、1080P を出し惜しみせず、残高を見ながらでなくシーンを撮り直せる余裕があります。

    ひと目で

    月あたりのクリップ
    5 秒 480P で ≈ 124 本
    1080P フルなら
    月 ≈ 31 本
    1 ドルあたりのクレジット
    Starter 比 +28%
    返金期間
    7 日間

よくある質問

Wan 3.0 リップシンク — 実際に持ち込まれる質問

顔をアップロードする前に答えておく価値のあるものだけ。数値は機能一覧ではなく、アリババ自身のパラメータ表から取っています。

リップシンクに音声ファイルは必要ですか

要りません — なので探すのをやめて大丈夫です。言葉をプロンプトの中に引用して画面の人物に紐づければ — She says: "Two minutes to set up."Wan 3.0 が絵と同じパスで自分で発話を生成し、口をそれに合わせて動かします。写真 1 枚と 1 つの文が入力の全部です。音声の録音はもう一方の経路で、声質が特定のものでなければならないときのためのものです。

説明されるのではなく、しゃべられる台詞はどう書きますか

引用して、誰かに紐づけてください。 アリババ自身のプロンプトの型は、話される内容を、それが帯びるべき感情・トーン・訛りと並べて置きます。このページのどのデモもそれに従っています — She says: "…"、それから言い回し。要約しただけの言葉はナレーションされるか、作られるかです。 このサイトのプロンプトツールは台詞を波かっこ {like this} で包みますが、これも台詞の始まりと終わりを示すという同じ仕事をしています。

台詞がしゃべられずに画面に印字されて出ました。なぜですか

プロンプトのどこにも印字するなと書いていなかったからです。このモデルにネガティブプロンプトの欄はないので、除外はふつうの文です — 「字幕なし、テキストオーバーレイなし」で締めれば、台詞は音声として出ます。Negative prompt: subtitles と書くのは逆効果で、その言葉自体が描くべきものになります。

写真と自分の音声の録音を一緒にアップロードできますか

1 つのリクエストではできません。 先頭フレームとして固定した写真はフレームの一族、音声トラックはリファレンスの一族に属していて、二つの族は排他です。リクエストは格下げではなく拒否されます。どちらかを選んでください:正確な冒頭フレームと生成された音声か、録音したあなたの声と、リファレンスとして添える画像か。

台詞はどれくらい長くできますか

買った秒数に収まるだけ。 プロンプト欄は 20,000 文字を抱え、クリップは 30 fps で 2〜30 秒を抱えるので、縛るのは時計です。上にあるアリババ自身の 30 秒デモは 6 つの台詞を収めていて、B ロールの拍を数えるとおよそ 5 秒に短い 1 文です。はみ出した台詞は早口になるか切られるかで、プロンプトをいくら長くしても直りません。秒数のほうを買ってください。

リップシンクはどの言語で働きますか

思うより多く、そしてその証拠はこのページの上にあります:屋上のクリップは 1 人の歌手が 8 言語を切り替えても同期が保たれるアリババ自身のデモですし、道場のクリップは会話を日本語で走らせています。存在しないのは、対応する発話言語の公開リストと、音素を固定するパラメータのほうです。ですから、よそで引用されている具体的な数字は誰かの推測として扱ってください。必要な言語で 480P の 3 秒を走らせてみてください — 採用 1 本のごく一部の費用で、あなたのケースについて答えが出ます。

同じクリップの中で 2 人が話せますか

話せます。 上のポッドキャストのクリップは、2 匹が 10 往復しています。話し手ごとに固有のラベルと、見分けがつくだけの記述を与え、各台詞をその話し手が目に見えてしている動作に紐づけ、それから言われる順に台詞を書いてください。代名詞は話し手を融合させるとアリババのガイダンスははっきり書いています —「彼が言う…それから彼が言う」は、2 人のキャラクターが 1 つの声になる書き方です。

発話には追加料金がかかりますか

かかりません。 課金は出力秒数と解像度だけなので、セリフのあるクリップは、同じクリップを無音で作った場合とまったく同じ値段です。リファレンス画像とリファレンス音声も課金されません。請求に足される唯一の入力はリファレンス「動画」で、その秒数は頼んだ秒数の上に、出力と同じ単価で課金されます。

話しているあいだ、画面の残りは静止したままですか

そう書いた場合だけ。 あなたの写真は 1 フレーム目であって、固定された背景板ではありません。その後はすべて生成されるので、プロンプトが固定しない限り部屋も光も画角も流れます。 上のアリババのデモは 2 本とも、まさにその点に一段落を使って、同一に保つべきものを名指ししています。プロンプト欄の横にある見た目の固定が、同じ一節をあなたのために書きます。

しゃべるクリップを商用で公開できますか

できます。 商用利用は全ての有料プランに含まれ、透かしはなく、別売りのライセンスもありません。アリババの利用ポリシーと本サイトの利用規約のもとで、です。制限はライセンスではなく顔のほうです:写真の人物と録音の声、その両方が同意している必要があります。

顔 1 つ、文 1 つ

ポートレートをアップロードして、言わせたい台詞を引用符で書いて、返ってくるものを聴いてみてください。Wan 3.0 のクリップ 1 本が 480P・3 秒まで無料 — メールのみ、カード不要。想像した言い回しでなかったとしても、費用はかかっていません。

wan-3.run 編集チームが執筆・管理しています公開 最終更新 ツール バージョン 2026.09.4