Guides

Wan 3.0 文档生视频:它拿你的提案做什么

五十页变成三十秒 —— 每页 0.6 秒。回来的是一支预告片,不是一次讲解,而搞清楚你要的是哪一种,决定了后面的一切。

8 分钟阅读wan-3.runwan-3.run
Wan 3.0 文档生视频:它拿你的提案做什么

Wan 3.0 能收一份幻灯片、一个 PDF、一张表格或者一个公开网页作为输入,然后交回一条视频。 没有别的主流视频模型做这件事,而这是这个模型身上最独特的一点。

它也是人们最快就会误解的那项能力,所以一句话把完整答案说清楚: 它读这份文档,再照着它学到的东西导一条片子。它不会把第三页变成第三个镜头。 在上限上,那是五十页压进三十秒 —— 每页 0.6 秒 —— 这道算术只可能产出一支预告片。

如果你要的就是一支预告片,Wan 3.0 做得相当出色。如果你要的是你的幻灯片出现在画面上、 有个声音把它们念出来,那这是错的工具,而这篇文章剩下的部分会替你省下积分。

文档和网页链接输入是一种有文档的媒体类型,不是一句营销说法: 见创建任务参数表里的 input.media.type,以及 Wan 3.0 API 文档。读于 2026-08-25。

限制,一张表

这里每一个数字都来自 Wan 3.0 API 文档,核于 2026-08-25。

取值
格式docx、doc、xlsx、xls、pptx、ppt、pdf、txt、key、pages、numbers、md
每个请求1 个文件,或者 1 个链接 —— 绝不能都要,也不能多份
文件大小100 MB
页数50
网页链接一个公开页面,不能要登录
输出最长 30 秒,480P / 720P / 1080P

其中两条会绊倒人。那个页数上限是页数,不是文件大小的替身, 所以一份很薄的 80 页 PDF 会失败,而一份很重的 40 页提案能过。 以及一个文件或一个链接意味着你没法把提案和产品页一起交给它, 而那恰恰是多数人第一反应想要的组合。

还有第三条,不那么显眼。文档输入属于 Wan 3.0 的参考族, 和参考图、参考画面、参考音频在一起 —— 而那一族与首帧、尾帧输入互斥。 你没法既提供一份提案,把开场那一帧钉死。这个请求会在生成之前失败。 完整的族规则在这里

它实际拿这些页面做什么

Wan 3.0 会读完整份文档,弄清楚它讲的是什么,然后照着那份理解导一条视频。 落到实处,这有三个值得预先规划的后果。

结构是被解读的,不是被保留的。 你的章节顺序是一个信号,不是一份分镜。 如果这套论证只有按你的顺序才讲得通,那就在提示词里说出来 —— 因为你可以在同一个请求里既发提示词发文档,而提示词正是你能用来引导的地方。

密度会被压扁。 三十秒装不下五十页的论证,所以模型会做取舍。 它从一份密集提案里选出来的东西,未必是你会选的那些, 而这正是第一次尝试让人失望的主要原因。

数字值得怀疑。 数据密集的源 —— 表格、财务提案、任何一个数位要紧的东西 —— 是这里最难预测的输入。在这条片子接近客户之前,请把画面上出现的每一个数字都核一遍。 这不是在贬低模型;这和你对任何一个含文字的生成画面会施加的谨慎,是同一种。

准备一份能产出像样视频的文档

这是没有哪份发布稿会讲的部分,而它造成的差别比提示词更大。

上传之前先砍。 五十页是上限,不是目标。同一份提案的十二页版本, 可靠地能产出比完整版更好的三十秒,因为选择是你做的,而不是委托出去的。 把附录、备用页、方法论那一节和团队页都剥掉。

把讯息放进前三分之一。 给一份长文档时,模型会给靠前的材料很高的权重。 如果你的结论住在最后一页,把它挪上来。

一份文档,一个想法,一条视频。 一份既讲产品发布讲招聘主张的提案, 产出的片子哪一个都不肯承诺。把文件拆开。

永远和文件一起发一条提示词。 Wan 3.0 在一个请求里两个都收: 文档提供实质,提示词提供处理方式。这是整套流程里杠杆最高的习惯,而一条短的就管用:

用附件里的提案做一条 20 秒的产品发布片。
取产品名、三项头条能力和发布日期。
忽略定价、路线图,以及关于团队的一切。
风格:干净的棚拍产品摄影,冷调中性色,每个节拍一次缓慢推进。
自信的旁白,一层轻的环境铺底,不要音乐重音。

注意那条提示词在做什么:它点名了要取什么、以及要忽略什么。 排除项在这里干的活比描述更多,因为你的文档装的东西远超三十秒能承载的量, 而默认的取舍是模型的,不是你的。

给链接同样的待遇。 一个公开网址的工作方式一样,同样的规则也适用 —— 一个产品页产出的片子比一个首页好,因为一个首页讲的是十一件事。

哪种源适合哪种产出

Wan 3.0 这些全都收,但收得并不一样好。

擅长什么要当心什么
PPT / Keynote发布片、品牌片、大会预热演讲备注里带着你的幻灯片没有的意思;把重要的那几条粘进提示词
PDF 报告有旁白的简报、摘要片长篇散文被压扁得最厉害 —— 砍到执行摘要
表格讲趋势和头条数字的片子核对画面上每一个数字。发那张汇总表,不要发原始数据
Markdown / TXT脚本、结构化的说明这一组里最干净的输入,因为没有版式要解读
网页链接产品页、发布贴、更新日志只能一个页面,公开,不能要登录。挑一个只讲一件事的页面

什么时候这是错的工具

值得直说,因为把人们带到这里的那次搜索,往往在找完全另一样东西。

如果你需要的是你的幻灯片按你的版式出现在画面上、有个旁白把它们念出来 —— 培训课件、合规材料、入职、任何多语言的东西 —— 那是另一个产品品类。 为「有旁白的幻灯片」而造的工具会保留你的设计,再加上一个声音或者一个出镜人。 Wan 3.0 做的正好相反:它丢掉版式,生成新的画面。两者没有谁更好; 它们回答的是不同的活儿,而挑错了会浪费一天。

一条经验法则:如果那份提案的设计就是交付物,别用生成式模型。 如果那份提案只是某样看起来会和它完全不同的东西的素材, 那这就是那个没有真正竞争对手的工具。

它多少钱

Wan 3.0 不为文档本身收钱。你付的是按你挑的分辨率算的输出秒数 —— 文件、它的页数或者它的大小,都不加钱,一个网页链接也一样。 只有参考画面的秒数会被加进账单,而一个文档任务一秒都没有。

所以一条从五十页提案做出来的二十秒发布片,和一条从文字提示词做出来的二十秒片子价钱完全一样: 按阿里巴巴公布的费率,480P $1.00、720P $2.00、1080P $4.00。

这指向那个显而易见的第一步。先在 480P 上把这份提案跑一遍。 文档任务第一次尝试没打中的概率比提示词任务更高, 因为 Wan 3.0 在做一些你此前没看它做过的编辑决定。 看一遍 480P 的结果,就知道它从你的文档里取了什么,然后你再写那条纠正它的提示词。 完整的成本算法

上传之前的六项检查

  1. 少于 50 页,小于 100 MB。
  2. 一个文件或者一个链接 —— 不能都要。
  3. 同一个请求里不要有首帧或尾帧图片。
  4. 附录、备用页和团队页都删掉。
  5. 结论挪进前三分之一。
  6. 附上一条提示词,点名要取什么、忽略什么。

常见问题

Wan 3.0 能把哪些文件类型变成视频?

docx、doc、xlsx、xls、pptx、ppt、pdf、txt、key、pages、numbers 和 md, 最多 50 页、100 MB —— 或者改成一个公开网页。每个请求一个文件或一个链接,绝不能都要。

Wan 3.0 会把每一页变成一个场景吗?

不会,而这是最常见的误解。它读完整份文档,再照着它学到的东西导一条视频。 五十页进三十秒是每页 0.6 秒,所以产出是一支预告片,不是一次翻页。

我能同时用一份文档和一张首帧图吗?

不能。文件和链接坐在参考族里,而那一族与首帧、尾帧输入互斥。 这个请求会在任何东西生成之前被拒。

文档更大会更贵吗?

不会。Wan 3.0 只按输出秒数计费。同样长度的片子,一份五十页的提案和一句话的提示词一个价, 而一个网页链接也不加钱。

它为什么把我提案里最重要的那部分忽略了?

通常是因为那部分在文档靠后,而提示词没有点名它。 把结论挪前、把不服务于这条片子的那些页砍掉,并在提示词里明确告诉它要取什么、忽略什么。

它能用我们的手册做一条培训视频吗?

它能做一条关于这份手册的三十秒片子。如果你需要把流程一步步教出来、按你的版式、带旁白, 那是有旁白的幻灯片类工具,不是一个生成式视频模型 —— 而这个错配值得在你花任何钱之前就抓住。


要弄清 Wan 3.0 从你的提案里取走什么,最便宜的办法是在 480P 上看它做一遍。 送一份文档进去,读一读回来的东西,然后写那条纠正它的提示词。

wan-3.run

作者

wan-3.run

独立的 Wan 3.0 界面

全部文章