Wan 3.0 视频转提示词
把任何一条片子读回成词
给它一条片子,拿回一条能做出类似东西的 Wan 3.0 提示词 —— 按阿里巴巴自己的顺序写,不是一句泛泛的图注。片子是在这个浏览器里打开的:过网络的是一张画面拼图和一条压缩过的音轨,绝不是你的文件。
你的 Wan 3.0 提示词
description主体 · 场景 · 运动 · 镜头sound场景自己发出的music或者不要音乐
三段,压平成 Wan 3.0 真正读的那一整段白话。这些标签属于这块面板,永远不属于提示词。
生成需要一个账号,而它上面的第一条片子不要钱:480P,最长三秒,带声音。
免费的次数,老实地数
在这个词上排名靠前的那些工具,一次收两到十个积分,而且积分包得在你看到任何东西之前先买。这一个不用账号每周给你一次,有账号每周三次,之后才开始收钱 —— 五个积分,是你在这里能生成的最便宜那条 Wan 3.0 片子的八分之一。
每一次运行都要解你的画面、转写音频,再让一个视觉模型看一遍结果 —— 所以和隔壁那个提示词生成器不同,这一个是计量的。价钱在你按下按钮之前就印在按钮上,这和一个先说「免费」、到第四次再拒绝你的工具正好相反。
免费,在每周次数以内
- 完全不用账号,每周一次
- 登录之后每周三次
- 从一个想法写一条提示词 —— 那一个没有计数器
- 读做好的提示词,就摆在它们的片子旁边
要消耗积分
- 超出每周免费次数的读取 —— 每次 5 积分
- 生成视频 —— 第一条算我们的:480P,最长三秒,带声音
- 720P 和 1080P,以及任何超过三秒的
开始不要卡,这里也没有什么会突然计费:提取器把自己的价钱印在按钮上,而失败的一次会把次数还回来。
它从一条片子里读出什么
结果不是一整段描述,而是按一条 Wan 3.0 提示词的组句层次到达 —— 于是在生成任何东西之前,你可以留下想要的部分,把其余的重写。
主体主体,描述成一样 Wan 3.0 能重拍的东西,而不是一句图注。场景地点、时辰,以及光从哪里来 —— 提示词把它留空时,Wan 3.0 会自己发明的那一层。运动什么在动、动多远、多快 —— 静止也算作一个选择。美学控制景别、运镜、看上去的焦段和景深 —— Wan 3.0 执行得最字面的那一层。风格化一个具名的风格,只在素材明显带着一个时才给。声音语音、音效、环境声和配乐 —— 以及静默,在它是刻意的时候。…压平成一整段Wan 3.0 收的是一条白话提示词,所以这些层次是这块面板的标签,从不到达模型。
语音是转写的,不是猜的
音轨是被转写而不是被描述的,所以一句对白回来时就是那句真话 —— 已经在大括号里,从描述中标记出来,于是 Wan 3.0 会把它演出来,而不是念一句概括。如果片子是静音的,结果会这么说,而不是替它编一条配乐。
她抬起头,然后 {雨停了。}
然后它会过同一套检查
提示词从读取器出来,直接进提示词生成器用的那十二条规则 —— 字符上限、区分大小写的点名、既没给幅度也没给速度的运镜。一次产出了 Wan 3.0 会做坏的东西的读取,会在你复制之前先说出来。
12 条规则,在你复制之前跑完
人们从一条参考片里拿走的五样东西
把目标点名,会改变读取里哪一部分最要紧,以及那条 Wan 3.0 提示词以什么开头。它是在运行之前问的,不是运行之后作为一个筛选项给出来的。
风格
style
调色、光、质感 —— 在任何东西动起来之前的那个观感。
构图
composition
构图与调度:东西摆在哪儿,眼睛怎么走。
运动
motion
编排与镜头路径,写成一个带幅度和速度的运镜 —— 那是 Wan 3.0 唯一会执行的运镜语法。
声音
sound
让它听上去很贵的那份混音,按 Wan 3.0 收的方式拆开。
角色
character
画面上是谁 —— 也是唯一一个从征得同意开始的目标。
肖像界线,见下
一段舞蹈片和一支香水广告也许共用一种调色,但你读它们的理由正好相反:前者读它的运动,后者读它的光。如果你真正想要的是保住原来的构图或原来的配乐而不是把它描述出来,那就到此为止,把文件本身交给参考生视频 —— Wan 3.0 一个请求能带最多五段参考片段,而一份拷贝每一次都胜过一段描述。
你的文件从不离开浏览器
这一类工具大多会上传你的视频。这一个在本地打开它,决定哪些地方值得看,然后送出两样很小的产物来搭那条 Wan 3.0 提示词 —— 这也是为什么进度条会点名每一秒花在哪台机器上。
在你的机器上打开
在标签页里解码,走浏览器自己的视频管线。到这一步什么都还没发出去,而如果你改主意,什么也不会发出去。
本地解码
扫一遍找切点
每秒采四次,找那些变化比这条片子平时更大的帧。一条手持长镜头和一段六切的蒙太奇需要不同的阈值,所以这条线是从片子本身来的。
每秒 4 次采样
拼成一张画面拼图
不用账号六帧,有账号八帧,两列排开。切点优先被占掉,这样没有哪个镜头会没被看见;剩下的铺在最宽的那些空隙上。
6 或 8 帧
音频被压小,不是整条上传
音轨会被重新编码成很小的一份,跟着拼图一起发出去。如果浏览器做不到 —— 最常见是 Safari —— 读取照样跑,而结果会说明声音是推出来的,不是听出来的。
~24 kbps Opus
看过,也听过
一个视觉模型读那张拼图,转写去读那条音轨,两边落进同一条提示词:画面上是什么,以及它听起来什么样。
拼图 + 音轨
按阿里巴巴的顺序组句
主体、场景、运动、美学控制、风格化 —— 压平成 Wan 3.0 真正读的那一整段白话,声音写在旁边而不是后面。
一条白话提示词
在你复制之前核过
和提示词生成器跑的同样那十二条规则,会把不过的那一行引出来。一次产出了 Wan 3.0 会当成画面文字渲染的东西的读取,会在这里被抓住,而不是在一次付费生成里。
12 条规则
你的片子正在发出的三种声音
抽关键帧的工具采的是静帧,也就是说它们是在静音状态下分析你的片子。
这一个会听,并且把听到的东西拆成三份 —— 因为 Wan 3.0 是把音频和画面在同一次生成里做出来的,所以提示词同时也是声音说明。后两者之间的判据只有一个问题:片子里的人听得见它吗?

对白
人们真正说出口的那些词,转写出来,放进它们所属那个镜头的大括号里。谁说的、怎么说的留在大括号外面的散文里。
{雨停了。}
声景
场景自己产生的一切:雨打在雨棚上、刀落在案板上、两条街外的车流 —— 每一样都带一个距离和一个落点。
sound
配乐
只有观众听得见的东西:乐器、速度、从哪里进来、在哪里收住。一条一点都没有的片子,回来时会这么说,而「不要音乐」本身就是一条 Wan 3.0 会照办的指令。
music
对声音一句不说,Wan 3.0 照样会生成一些 —— 由模型自己挑。这就是「从参考里把它读出来,而不是把这个字段留空」的理由。
一条 60 秒的片子不会变成一条 60 秒的提示词
Wan 3.0 生成二到三十秒,而你的参考多半不是这个长度。
它会读的最长 60 秒的源
Wan 3.0 生成的2–30 秒,30 fps
挑一个目标长度,读取就会按它裁好。当源比目标长时 —— 大多数时候都是 —— 这个工具会停下来问,而不是悄悄读一条三十四秒视频的前八秒、还只字不提。
两种回答方式:取一段连续的区间,把它拖到好的那一段上;或者留下整条片子让它被压缩,再把你不想要的节拍否掉。第二种是一条真正不同的指令 —— 模型被告知这些帧横跨整条片子、并被要求去压缩,而不是去描述一个窗口 —— 而把这一点搞错,产出的就是一张一秒一个镜头、谁都执行不了的时间表。
它找到的节拍画在一条你可以点的条带上,所以机器的品味只是一个建议,不是一个决定。
这条视频是谁的?
读一条片子并不转移它里面的任何权利。你带走的提示词是你的;那段素材仍然是他们的。
- 风格知道一条片子靠的是黄金时刻的光和一次缓慢推进,这没问题。风格不是任何人拥有的东西。
- 一个具体作品把一部可辨认的电影或广告一个镜头一个镜头重建出来,就不行,不管这次重建是怎么做的。
- 一个真实的人把一个真实、可辨认的人描述进一个模型里需要他本人同意,而从一条片子上读他的脸并不能取得这份同意。
- 音乐请描述一种情绪和一套配器。重建某一首具体的歌是另一回事,而且它有另一个权利人。
- 标志与产品不管这条视频是怎么做出来的,它们都受保护。实用的判据:如果你不会把那条片子放进自己的广告里,那也别在这里重建它。
把这条提示词带去生成器
这条提示词是纯文本,而且是你的 —— 粘到任何地方都行。但从这里出发最短的一条路,是结果面板里那个按钮:它会把提示词带进本站一个真正的 Wan 3.0 生成器,长度和画面比例已经设成你读它时用的那一套。
01
读它,然后改它
每一段都由你改,而检查会对着你留下的东西重新跑。
02
按面板里那个按钮
提示词、长度和比例一起过去,所以什么都不用重打。
03
生成
这一步需要一个账号,而它上面的第一条片子不要钱:Wan 3.0 本体,480P,最长三秒,带声音。
一条提示词是一段描述,而一段描述是刻意有损的。如果目标是保住原件,而不是照着它的精神重做一个,那么文件本身才是更好的输入。
是这一个,还是另外四个之一?
在这里把它描述出来;要保住它,就改成把文件交给 Wan 3.0。你想要哪一个,决定去哪一页。
从它身上学
这条片子为什么好看?本页
做一条像它的
一条带着它精神的新片子本页
手上没有片子
只有一个想法、没有素材 —— 而且没有计数器提示词生成器
保住它
留住构图、主体或者配乐参考生视频
改动它
给真实素材重新配音,或者把它接下去视频转视频
描述一条片子是刻意有损的,而当目标是搞懂它为什么好看时,这份损失正是重点。当目标是保住原来的构图、光线或配乐时,就别再描述了:参考生视频能保住一次重写只能逼近的东西,而给真实素材重新配音或者把它接下去,是视频剪辑的活。
描述是唯一出路的那种情况,是一个你根本没法上传的源 —— 别人的素材,或者私有材料 —— 因为一段你自己写的描述,是你的,而一份拷贝永远不是。
既没有片子也还没有想法?做好的提示词,印全了,就摆在它们做出的片子旁边。
Wan 3.0 视频转提示词常见问题
一条参考片能告诉你它背后的提示词什么,以及怎么把那些变成一条 Wan 3.0 提示词
Wan 3.0 视频转提示词到底做什么?
我会拿回一模一样的那条视频吗?
Wan 3.0 视频转提示词免费吗?
为什么这一个要计数,而提示词生成器不用?
我能给它什么,片子能多长?
我上传的东西会怎么样?
它会转写对白吗?
我的参考只有六秒。能拿到三十秒吗?
我能读一条社交媒体上的片子吗?
它能反过来走吗 —— 从想法到提示词?
给它一条片子,把它读回成一条提示词。
文件留在你的浏览器里,每周第一次读不要钱,而你复制走的东西是你的。在 Wan 3.0 上把它生成出来需要一个邮箱 —— 第一条片子算我们的。
由 wan-3.run 编辑团队撰写与维护发布于 最后更新 工具 版本 2026.09.4