Wan 3.0 图生视频
丢一张照片进去,它就动起来。再加第二张,Wan 3.0 图生视频就从首帧走到尾帧。二到三十秒,声音在同一个文件里,而你的第一条不要钱 —— 一个邮箱,不要卡。
两条已发布的 Wan 3.0 范例,后面是站上其余全部想法 · 点「试这条」会把提示词和它的帧一起装进来
起始帧 · 16:9 · 720P用四处小改动唤醒一张静帧
Wan 3.0 图生视频
拿你的照片做什么
你的照片会成为真正的第一帧 —— 不是风格参考,是这个镜头字面意义上的开头。

第 001 帧 · 你的
由你描述的内容生成
Wan 3.0 图生视频把一张图片当作开场那一帧,从它出发生成 2 到 30 秒的运动,30 fps,480P、720P 或 1080P,音频在同一次生成里。再给一张图片,它就成为收尾那一帧,中间那段路由模型补上。
- 你的照片就是第一帧
- 001
- 任意整秒
- 2–30 秒
- 帧率
- 30 fps
- 分辨率
- 480P / 720P / 1080P
你的照片就是第一帧
任意整秒
帧率
分辨率
- 不收 HEIC —— iPhone 的默认容器不在接受清单里
- 不收透明 —— PNG 的透明通道是被拒,不是被压平
- 参考图不能和首帧同时出现 —— 这两族互相排斥
首帧、尾帧,
还是两个都给
Wan 3.0 图生视频是一个接口,两条入口。选错那一条,是结果让人觉得不对劲最常见的原因,所以下面写清楚各自在什么时候是正确答案 —— 以及另一条为什么不是。
只给首帧
first_frame
一张照片作为首帧。你的视频从你的图片开场,并从那里往前走。当你已经有了开场镜头、想看看 Wan 3.0 接下来会拿它做什么时,用这个。
怎么写
描述接下来发生什么,不要描述画面里已经有什么 —— Wan 3.0 已经看得见那张图了。文生视频没法保证产出和你的照片有任何相似之处,而这正是你在这一页的理由。
首帧 + 尾帧
first_frame + last_frame

两张照片,一个起点一个终点。Wan 3.0 把中间那段路补上。当你确切知道这个镜头从哪开始、又必须落在哪里时用它 —— 产品转一圈、前后对比、场景切换。
怎么写
只给首帧时,是 Wan 3.0 决定终点,而它猜不到你的结尾。如果两张图差得很远,请把中间发生什么用足够多的字说清楚,否则它会自己发明一个转场。
有一条硬规则:帧那一族和参考那一族不能混。在同一个请求里既发首帧又发参考图,Wan 3.0 会直接拒绝,而不是替你挑一个 —— 要把同一个角色带过好几个镜头,那是参考生视频。完全没有源图?从文字开始。更多做好的设置写在提示词范例里。 而当不许动的是整个画面本身 —— 一块屏幕、一个房间、一张数字表 —— 那属于另一类镜头。
一个图片文件,
还是那张图所在的页
图生视频需要一个文件。如果你手上只有一条链接——商品页、规格页、一篇帖子——这个站还有第二道门,而它做的是另一件事,不是同一件。
图生视频用的是那张图本身。 你的照片会成为首帧,模型从那里往前走,所以视频里的主体就是你上传的主体。网址转视频从不碰那张图。 它读的是页面说了什么,再据此生成全新画面,页面上的东西一样都不会出现在成片里。要让东西看起来就是你的东西,用前者;手上只有一个页面、没有拍摄,用后者。
01
你有文件
丢进页面最上方那个框。这一页的检查器会在你花掉一格额度之前,指出哪一条限制会挡下它。
02
你有链接
网址转视频收一个公开网址,读它背后那一页。它自己的检查免费,也不需要账号。
03
两者都没有
文生视频只从一段写好的提示词出发,一样是三十秒,一样在同一趟里把声音写出来。
网址转视频是链接那条路,文生视频是提示词那条路。三条跑的都是同一个 wan3.0-video,每秒单价相同。
你的浏览器打得开的链接,不等于模型抓得到:算图发生在另一张网上。链接检查器会指出那张网上已实测拒收的主机。
花掉一个积分之前,
先检查你的图片
丢掉一次生成最恼人的方式,是事后才发现这个文件本来就不可能成。把一张图片丢在这里,它会照着 Wan 3.0 真实的限制过一遍 —— 格式、大小、尺寸、比例和透明度 —— 哪一项不过,就点名哪一项的修法。什么都不会上传:检查在你的浏览器里跑。
JPG · JPEG · PNG · BMP · WEBP · ≤20.0 MB · 240–8,000px · ratio ≤8:1
想跑多少次跑多少次 —— 每一批之前都跑一遍也行。这个检查器从不碰模型,所以 Wan 3.0 图生视频不会为一个本来就不可能成的文件收你的钱。
Wan 3.0 的图片限制 ——
以及哪些数字是旧的
搜一搜 Wan 的图片尺寸限制,你会找到好几个不同的答案,全都来自阿里巴巴,也全都是对的 —— 只不过说的是另一个模型。这里是 Wan 3.0 那一栏,而这一页顶部的上传框会在你花钱之前把每一行都核一遍。
iPhone 照片没法直接进去。 HEIC 是 iPhone 的默认格式,而 Wan 3.0 读不了这个容器 —— 检查器一秒就能抓到,并点名要改哪个设置。
阿里巴巴把更老的图生视频文档一直挂着、也一直被索引着,而它排名很好,因为它在那儿的时间更长。两个页面都准确;只有一个说的是 Wan 3.0。辨别的记号是模型 id —— 如果那一页上任何地方写着 wan2.1、wan2.2 或 kf2v,它的数字就不是这个生成器用的那一套:那份文档给的是 800 提示词字符、360–2,000 px、10 MB 和固定五秒,而 Wan 3.0 是 20,000 字符、240–8,000 px、20 MB,以及 2 到 30 之间的任意整数秒。
它会改我的脸吗?
让主体不要漂移
漂移就是第八秒那张脸和第一秒那张不太一样 —— 同一张照片,跑了两遍。
Wan 3.0 对开场那一帧保持得不错,而片子越长、镜头动得越多,就保持得越差。如果你的提示词只描述运动,那么你没描述的每一样东西都是敞开的,模型可以随便把它们重新发明一遍。
有三件事有帮助,按帮助大小排。给这个运动一个去处 ——「转身面向窗户」比「四处走动」保持得好。让镜头老实一点:一条片子里只点名一个运镜,因为 Wan 3.0 在一次推进里跟住一个主体,比在一段没说清楚的手持游走里可靠得多。以及在硬扛之前先缩短 —— 一条会漂移的二十秒片子,往往能变成两条干净的十秒片子,生成更便宜,也更好剪。

大衣的织纹变了,发际线也挪了。提示词里没有任何一句说它们不该变。

同样的运镜,同样的长度,同样的种子条件。唯一的改动就是那一句约束。
它们之间唯一的差别
主体 —— 红色羊毛大衣、深色齐刘海、左手一枚银戒 —— 全程保持同样的脸、头发、服装和颜色;只有镜头和描述过的运动会变。
把不许变的东西打出来 —— 一个颜色、一个标志、一张脸。名词越具体,Wan 3.0 就越少去重新解释它。
会接在你提示词的末尾
主体全程保持同样的脸、头发、服装和颜色;只有镜头和描述过的运动会变。
这件事的长版本 —— 漂移从哪儿来、那一句约束能保住什么、又保不住什么 —— 在角色一致性上。如果这个主体必须活过好几个分开的镜头而不是一条长镜头,那是另一种模式:参考生视频能收同一个角色最多十张图,并让它跨多次生成保持住。它不能在同一个请求里和首帧组合。 锁住一块屏幕而不是一张脸,是同一条指令放大一号。
为什么 Wan 3.0 从你的图片
取画面比例
把比例留在自适应上,产出就跟着你的源图走,而这几乎总是你想要的 —— 一张竖图变成一条竖片,什么都不裁,什么都不补。这和文生视频正好相反,那里没有图可读,你必须自己选。Wan 3.0 支持自适应,外加 16:9、4:3、1:1、3:4 和 9:16。
图生视频 · 本页
ratio: adaptive
从你上传的那张图读出来的。可以改,但它已经知道了。
文生视频
ratio: 必填
自适应会被直接拒 —— 没有图可以据此推出画幅。
只有当发布位置强制要求、而且你愿意丢掉边缘时,才去设一个显式比例 —— 一张 4:3 的照片留在自适应上会得到一条 4:3 的视频,在手机信息流里它会缩成一条加了黑边的窄块。Wan 3.0 里没有 21:9:要一条宽银幕的横条,请按 16:9 生成,再到剪辑软件里裁,而不是去找一个不存在的设置。
写的是转变,
不是画面
这是首尾帧模式里人们最容易写错的部分。Wan 3.0 已经看得见这两张图 —— 它不需要你描述里面有什么。它需要的是它们之间发生了什么。
Describing the picture
Describing the change
一个小女孩在温暖的房间里微笑
一个小女孩从微笑逐渐转为大笑,镜头缓慢推进,背景光从冷调转向暖调。
桌上一个合着的产品盒
盒盖在四秒里抬开,镜头随内容物露出而降到低角度,开启时一声轻响。
第一组是阿里巴巴自己给首尾帧模式的示例提示词 —— 值得读两遍,因为它点名了三样各自在变的东西:表情、镜头,还有光。
任何长度都是同一条原则:把变化点名,把镜头点名,把声音点名。如果提示词里没有任何一句描述运动,Wan 3.0 就会自己发明一些。想让人替你把措辞搭好?提示词搭建器。 它最严格的那一种形态,是一个完全不允许移动的画面。
当不许动的那个东西
占满了整个画面
人脸漂一点,镜头照样成立;后台界面不行。如果你要动的那张图本身就是产品 —— 一块屏幕、一个房间、一张数字表 —— 每一个像素都在承重,而那句把它按住的话必须写在提示词最前面,不是补在最后。
这就是上面首帧和尾帧的同一套机制,只是对准了更难的一种情况:你要Wan 3.0 图生视频只改一块地方,其余全部留在原位。
数字在跳,界面一动不动
销售额从 100.00 一路跳到 30,197.00,而侧边栏、图表坐标轴、列标题全部钉死。这就是很多人想用录屏拍表格来凑的后台数据动效,而它多半会失败 —— 因为录屏里有光标。
你提供
同一块屏幕两张:一张小数字,一张大数字。
一块还不存在的界面
开发还没做完、或者手上没有可录屏的设备时就要交的应用演示视频。所谓样机视频,就是一张静态图加一个终点 —— 菜单展开、面板填满、开关拨过去 —— 而镜头始终不动。
你提供
从设计稿导出的两张图。不需要原型、不需要插件、不需要录屏。
房子不动,东西进来
从空房到家具齐全,从毛坯墙到完成面。不许动的是建筑本身,其余都可以动。
你提供
同一机位拍的改造前和改造后两张照片。
真正起作用的是这一句
三个互不相识的人写出了几乎一样的一句话。出现这种情况,通常说明这句话补上了模型确实需要的东西。整段复制下面这些,只替换方括号里的两行,其余别动:
Use image 1 as the starting frame and image 2 as the ending frame. The animation must begin exactly with image 1 and end exactly with image 2. Lock the entire frame in place: same layout, same crop, same camera. No pan, no tilt, no zoom, no perspective change, no re-rendering of the surrounding elements. The only thing that changes is [WHAT MOVES]. [HOW IT MOVES — e.g. the figures count upward smoothly through many intermediate values until they reach the final number.]
为什么是这个顺序:模型给提示词开头的权重高于结尾,所以锁定必须写在描述变化之前。把 Lock the entire frame 放在最后一段,它读起来是一个偏好;放在第二段,它读起来是一条约束。
会漂的三种情况,和各自那一行
你没让它推,镜头却在慢慢往里推
有运动是默认值。没有指令,模型就自己补一点。
The camera is locked off. No push-in, no drift, no handheld motion.
版式是对的,但小字变成了另一批小字
文字是被重画的,不是被复制的。
Do not redraw text. Keep every label, header and axis exactly as supplied.
它在两张图之间切了一刀,而不是走过去
只有两个端点、中间没有东西连着,就会被读成一次剪切。
One continuous shot. Interpolate every intermediate state; no cut, no fade, no dissolve.
它保什么,不保什么
它保的是版式与位置。它不保证字形与字符:一个数字可能变成另一个数字,六号字的标签可能变成看起来像标签的六号字形状。
检查这件事只要十秒,而且每次都值得做:拉到最后一帧,放到 100% 看,只读那一个让这条片子存在的数字。它在最后一帧是对的,整段计数就是对的;不对就用同样两张图重跑一次,并把那个数字写进提示词。
这条边界就是你在两类工具之间做选择的全部依据。如果你的截图必须一个字节都不变,你要的是一个在现有图片上做平移和缩放的拼接工具。如果你要的是一帧从来没有被拍到过的画面 —— 数到一半的数字、开了一半的面板、家具摆到一半的房间 —— 那它只能被生成出来,而这里就是生成的那一边。
槽位还是首帧和尾帧的那两个,这里变的只是你在中间写什么。
一条 Wan 3.0 图生视频的片子要多少钱
和文生视频完全一样:长度和分辨率定价格,音频不定,多传一张尾帧也不另收钱。失败的生成会自动退回 —— 而有了上面那个检查器,过去让人白花积分的失败,大多数根本到不了模型那儿。
这一项怎么计费
- 计费单位
- 输出秒
- 失败的生成
- refunded
- 你的第一条片子
- 不要钱 · 480P
先在 480P 打草稿把运动找准,再让留下来的那条在 720P 或 1080P 上跑一次 —— 两次之间图片不用重新检查。完整价目表。
两种付法,每月积分一样
怎么用 Wan 3.0 图生视频
让一张静图动起来
决定结果的是第三步:描述你固定住的那两帧之间有什么在变,而不是它们里面有什么。
把首帧丢进来
检查立刻在你的浏览器里跑完。合格的文件亮一行绿色;不合格的会在你花钱之前把修法给你。
检查不要钱如果你知道结尾,再加一张尾帧
一张图就够了 —— Wan 3.0 会自己决定镜头走向。再给一张,它就成为收尾那一帧。
可选说什么在变,不是说那里有什么
Wan 3.0 已经看得见这些图了。请描述它们之间的运动、镜头,还有声音。
声音写在同一个字段里设长度和分辨率,然后生成
2 到 30 之间的任意整数秒,30 fps,480P、720P 或 1080P,返回一个把音频装在里面的 MP4。
最高 1080P
短片子大约九十秒,跑的时候你可以关掉标签页。上传的照片永远不会被改动 —— 产出是一个新文件。
Wan 3.0 图生视频常见问题
Wan 3.0 图生视频从你的静图里保住什么、它可以自由改动什么,以及跑一次要多少钱
让照片动起来要注册吗?
Wan 3.0 接受哪些图片格式?
为什么我的 iPhone 照片传不上去?
图片尺寸限制是多少?
我一定要给尾帧吗?
我能同时用参考图和首帧吗?
一条 Wan 3.0 图生视频的片子能多长?
视频会保持我图片的画面比例吗?
Wan 3.0 图生视频也会生成声音吗?
生成失败了会怎样?
Wan 3.0 能把截图变成视频吗?
不录屏,怎么做应用演示视频?
我明明写了不要动,后台数据动效为什么还在漂?
带一张照片来,换一条片子走
把图片丢进来,让检查器确认一遍,然后生成。一条不要钱的 Wan 3.0 片子,480P,最长三秒 —— 一个邮箱,不要卡。如果运动不是你想的那样,它没花你的钱。
由 wan-3.run 编辑团队撰写与维护发布于 最后更新 工具 版本 2026.09.4
