Episode: Wan3.0 正式上线:AI 视频闯进 30 秒时代
Duration: approximately 6 minutes
Level: 入门
---
[Mike]: 欢迎来到从零开始学AI!我是 Mike。Sarah,先问你一个问题——你有没有发现,AI 生成的视频大多只有几秒钟?
[Sarah]: 还真是。刷到的那些 AI 视频,五秒十秒就完了,看个循环动画还行,想看个完整的小故事根本不够。
[Mike]: 对,这不是巧合,是技术真的难。不过今天这条新闻把这个限制打破了——阿里的视频生成模型万相 Wan3.0 正式上线,一次能生成 30 秒。
[Sarah]: 30 秒!等等,讲新闻之前先给我补补课——为什么 AI 视频以前都这么短?
[Mike]: 好,这个问题值得先讲清楚。你可以把 AI 生成视频想象成做翻页动画:每一页画得好看只是一半功夫,真正难的是页与页之间要接得上。
[Sarah]: 明白,就是上一页的人和下一页的人得是同一个人。
[Mike]: 没错。AI 视频有三个经典的翻车点。第一个,脸会变——镜头一推近,主角换了个长相。
[Sarah]: 我刷到过这种!看着看着,男主角突然换了个头。
[Mike]: 第二个,物体会漂移。桌上的杯子,喝一口茶的功夫位置就对不上了,甚至直接穿进桌子里。
[Sarah]: 第三个我猜猜——是不是不符合物理规律?比如手指多一根,或者头发飘的方向跟风不一样?
[Mike]: 完全正确。所以以前的模型干脆少生成几秒,时间越短越不容易露馅。
[Sarah]: 原来短不是偷懒,是在避难。那这个 Wan3.0 是怎么敢做 30 秒的?
[Mike]: 它 8 月 6 号就开始公测了,这十多天里天天都在进化,今天正式上线。你要知道 30 秒意味着什么——能讲一个有开头、有转折、有结尾的完整小片段了。
[Sarah]: 而且中间还能切镜头吧?不是固定一个画面撑满 30 秒?
[Mike]: 这正是它被夸的地方——跨镜头一致性。有个创作者拍了部短片,叫《出售回忆的酒吧》,讲一家可以买回忆的酒吧。
[Sarah]: 这个设定有意思。画质呢?脸没换人吧?
[Mike]: 从中景一路推到大特写,主角的脸稳稳的。更绝的是玻璃瓶身上还反射着酒吧里的景象,琥珀色的灯光从头到尾一个调子。
[Sarah]: 玻璃反射室内景,这个连真实拍摄都要专门布光才能做好。
[Mike]: 还有家评测团队叫 Flova,专门找难点测试:一个镜头里同时放了眼球反射、飘动的头发、飞起来的白纱和闪光的水面——四样 AI 最容易崩的东西。
[Sarah]: 结果呢?
[Mike]: 全守住了,皮肤也没有那种塑料感。海外一家公司 Koyal.ai 测了六个动画类别,Wan3.0 总分排名第一。
[Sarah]: 概念课继续。我记得大家以前管出 AI 视频叫抽卡?这个词我一直没搞懂。
[Mike]: 因为早期 AI 出片全凭运气,像抽卡游戏,也像拉老虎机——同一个提示词生成十次,可能九次不能用。有个平台 LibTV 用它做了场追车戏,车辆、司机、街道 30 秒保持一致,基本不用反复重抽。
[Sarah]: 老虎机变成稳定出货了。对了,我还看到说它能直接读文档?
[Mike]: 这是另一个大招。Word、Excel、PPT、PDF,甚至 Markdown 文件扔进去,它能按内容做出一段视频。
[Sarah]: 等等,那我把会议记录丢进去,就能得到一支视频版周报?
[Mike]: 理论上还真能。现在用它的行业已经很多了:短剧团队拿它批量出片,广告公司说商品和 Logo 不变形、口播很自然,文旅账号用它重现古城晚霞和宫墙红叶。
[Sarah]: 还有音乐人——上传一张歌手照片,标注对口型唱歌,自动切出好几个机位,成品直接当音乐视频用。
[Mike]: 价格也不贵:API 生成 480P 每秒 0.3 元,720P 是 0.6 元,1080P 是 1.2 元,9 月 23 日之前还有 7 折优惠。
[Sarah]: 你发现没有,这件事真正的变化是什么?以前拍片子,门槛是钱——请人、租设备、搭景。现在门槛变成了想法。
[Mike]: 对,从抽奖机变成了剧组。以前问的是你付得起吗,现在问的是你想得出吗。
[Sarah]: 说得我心痒了。我已经在想,把我那份写了半年的周报做成一部史诗级大片,开场就是航拍办公室。
[Mike]: 配乐记得选激昂的。另外你不是总说自己五音不全吗?以后标注个对口型,AI 替你唱,你负责出镜就行。
[Sarah]: 那我可要去发单曲了。听众朋友们,如果你也有想拍的画面,欢迎留言告诉我们。下期从零开始学AI,再见!
[Mike]: 下期见!
