80.与梅涛院士的 3 小时访谈:语言、视频、具身终将汇聚,为什么是世界模型?卫诗婕|漫谈Light the Star

80.与梅涛院士的 3 小时访谈:语言、视频、具身终将汇聚,为什么是世界模型?

203分钟 ·
播放数4014
·
评论数19

从语言大模型,到多模态至全模态模型,再到走向世界模型…

世界正在经历什么?

本期节目我邀请了加拿大外籍院士、智象未来 Hidream的创始人梅涛,还原视频生成模型的技术发展史。

梅涛院士是全球首篇文生视频论文的作者,也是最早探索文生视频的人。

2026 年 5 月 20 日,Google I/O 大会上,Pichai 发布了 Gemini Omni —— Google 第一个原生「any-to-any」的全模态模型:文本、图像、视频、语音都在同一个 Transformer 里原生流动,不再是几个模型拼接——这与梅涛一直以来的主张不谋而合。

与此同时,OpenAI 悄悄砍掉了 Sora 项目,更多聚焦 Coding——硅谷正在做减法。

但中国一侧的多模态战场却没有收敛,从多模态、全模态到世界模型,多模的架构层面正在发生一轮新的分化:DIT、UIT、Omni 各自赌不同的路。

梅涛,作为最懂视频模型的人之一,正是选择从底层架构下场的创业者,他致力于打造「视频界的 Anthropic」。

我们从他的中科大、微软亚研院岁月,一路聊到这场世界模型的创业之旅。梅涛的模型世界观可以用一句话精炼,那就是:

图片是入口,视频是过程,世界模型是终局。

语言、视频、具身,终将汇聚。

这期的信息量极大,但技术门槛较高,不过,其中穿插着大量生动比喻,跟随下来,也能对当下的AI 趋势进行一场深入的了解。推荐大家收听~

本期嘉宾:梅涛(加拿大工程院外籍院士、智象未来 HiDream 创始人)

本期 Shownotes:

03:35 视频领域的 Anthropic :图片是刀, 视频是过程

  • 学 Anthropic 的三件事: 团队从 OpenAI 出来后极度稳定(智象核心作者从 2017 年起就没走过一个)、坚定做企业服务、通过开源建立自我逼迫的创新节奏

  • 视频领域的刀是图片 : 图片是二维/三维信号的入口,今天客户在平台上创作的时间 50%-60% 花在做一张图上

  • 多模的成长路径:图片模型 → 视频模型 → 全模态模型 → 世界模型

  • 能不能把图片做到全球最好,是视频公司真正的分水岭:Google 的 Veo 3 之所以强,是因为 Google 本身有很好的图片模型

08:25 院士里少有的「躬身入局」:全职 20 年的工业界履历

  • 中科大→微软亚研 10 年→京东探索研究院 5 年→2023 年创立智象;从没拿过第二份薪水,始终全职

  • 导师张宏江的习惯:看汇报从最后一页往前翻,5 分钟就把半小时的 slides 看完

  • 「用 AI 分析理解视频」的任务,跨越 6 年才完成——多模态、全模态、世界模型都是那份实习任务的延长线

  • 好的 mentor 给的 assignment 都不是「当下能做出来」的,而是「你的整条职业生涯都要围绕它推进」的

  • 反人性才能获得长久的正反馈,负反馈也是正反馈

  • 微软亚研院的土壤:这样的 R to D 通道今天几乎绝迹

29:00 微软 R&D 分离 vs OpenAI 融合:今天模型就是产品

  • 微软时代:研究员做 paper → 10 个工程师转化成产品 → 100 个工程师做产品化,大半年才能进产品线

  • OpenAI 这一代:researcher 和 engineer 完全融合,R&D 之间不再有转化层

  • 研究员今天为什么这么贵——因为他们直接是产品线;研究判断本身就是产品判断

  • 如果你的研究和工程仍是两个团队,你比大厂慢的不是资源,而是决策速度

31:27 AI 不是足球赛而是篮球比赛:第一节快结束了

  • toC 是 toB 的放大器——C 端最先感知模型能力的溢出、贡献社区反馈、做 branding

  • 中国 AI 创业的三个关键词:全球化、出海、软硬件一体

  • AI 的四节比赛:大模型比拼、 agent(通用+垂直)、终端流量入口/软硬件、第四节待定

  • AI 时代,toB 和 toC 的边界越来越模糊:创业公司不必二选一

  • 后面的迭代周期会更短:基模半年一次大迭代,Agent 可能三个月一次,终端和交互还会更快

42:15 Sam vs Dario:一号位视角 vs 单点技术执念

  • Dario 是理想主义者(读社会学、历史、哲学);Sam 是投资人出身,更现实

  • 讲宏大叙事等不到爆发那天就会死

  • 中国投资人的三重反射弧——需要沿途下蛋、追共识不追共识外、经历过 toC 时代所以对 toB 天花板有本能的低估——这些都改变了中国创业者能选的叙事结构:你必须在讲远期愿景的同时不断证明近期商业化

  • 「长期看 Anthropic 和 OpenAI 的曲线一定会交织」

47:10 从 TGANs-C 到 UiT:做视频模型,创业公司为什么必须换架构

  • 做出全球第一篇文生视频论文 TGANs-C (2017):使用 GAN 与卷积神经网络,只能生成约 3—4 秒、48×48 像素的模糊视频,但证明了文本可以反向生成视频

  • 视频生成模型经历了 GAN、Diffusion、DiT 几轮架构变化:主干网络从 CNN 换成 Transformer 后,模型才获得更强的上下文和规模化能力

  • DiT 需要先把文字、图片和视频压进隐空间,再编码、解码;压缩会损失细节,也让像素级控制变得困难——字节等大厂可以在此基础上大力出奇迹,但始终有些事做不到

  • 智象在探索的UiT: 尝试取消外部 VAE,让原始像素、文本 Token 和任务条件进入统一空间,直接完成跨模态交互

  • 创业公司必须思考如何避开大厂的车辙,如何优化成本曲线,逼近大厂的优势

  • 「架构上的领先只能持续六个月」:开源是一场持续创新考试

  • 为什么视频模型目前仍然是创业公司玩得起的游戏?千卡级训练仍给创业公司留有窗口

01:17:15 像素没有统计意义:多模态还在 GPT-2 阶段

  • 语言是经过人类数千年压缩的结构化知识,而视觉信号缺少公认的 Token 定义,「像素没有统计意义」

  • 文本可以用 next-token prediction 自监督训练,图像和视频通常需要成对的内容与高质量描述,监督成本更高

  • 视觉 Scaling Law 会出现,但不一定复刻语言模型的路径;数据、算法和算力都还没有形成统一范式

  • 目前视觉不负责产生智能,而在于复刻

  • 多模态消耗数据的速度仍赶不上人类产生视觉数据的速度

01:27:50 世界模型不是一个模型:三条路还没有交汇

  • 杨立昆的 JEPA 路线关注 next state 与世界状态预测;李飞飞更侧重 3D 世界重建;视频生成派则希望从海量真实视频中学习物理规律

  • 视频模型的数据更通用、参数体量更大,可以成为世界模型的基础底座,再向具身或交互式任务迁移

  • 图片、第三人称视频、第一人称视频和具身真机数据各自覆盖不同分布,单靠真机数据很难获得足够泛化

  • 生成与理解目前仍是两套路线,真正的大一统架构尚未出现。

  • 世界模型现阶段更像一组不同目标、数据和训练方式的模型家族。具身、3D 和视频都只是路径,过早把它们压成一个答案,会遮住真正的架构问题

01:41:16 从微软、京东到 HiDream:创业没有标准答案,在迷雾中寻找航向

  • 通用视频模型底座的商业化

  • 技术创业选赛道时,「未来足够大」还不够。能否沿途形成收入、数据和产品反馈,决定团队有没有机会等到终局。

  • 判断模型是否真正创新,不能只看公开榜单;模型公司会用自己的测试集和极限 Prompt 检查边界能力。

  • 好的 Leadership :清晰目标、可执行路径、利他和技术使命感

  • 快速不仅指把正确路线跑快,也包括更早承认路线不对

02:08:53 通往世界模型:下一代架构可能已在萌芽

  • 从多模态、全模态走向世界模型是通向 AGI 或 ASI 的必经阶段

  • 当前的 Transformer 未必足以承载所有模态和交互,下一代架构可能已经在萌芽

  • 让博士生和研究员持续筛论文、做小规模试错,再把有潜力的方向放大到产业级训练

  • 发现下一代架构靠的不是一次灵感,而是一套持续感知机制

02:19:34 世界模型不等于具身:图片是扎马步,最大的数据量目前来自视频模型公司

  • 自动驾驶、视频、3D 和机器人都有各自的世界模型叙事。

  • 智象的「具身世界模型」路径:先把图片质量做高,再扩展视频长度、实时性和可交互性,最后延伸到高精度的物理世界任务。

  • 「像智象这样的公司,一年都是 100 PB 级年度视频数据」:视频仍是当前最可规模化的物理世界信号

  • 图片不是视频模型的过渡版本,而是最低成本的基本功测试——构图、像素控制和角色一致性做不稳,视频越长,错误只会被继续放大。

02:28:49 多模态商业化:智能未涌现,表现力先变现

  • 「多模不会一家独大」

  • Agent 的价值不只取决于基模,还取决于 Harness、Skills、成本控制和行业 know-how

  • 多模态还没有出现语言模型式的智能涌现,却已经出现表现力涌现。商业化可以早于技术终局。

  • 「Token 将来价值会越来越薄,因为它成为了一种 commodity。」

02:42:06 船票的本质:模型能力与商业化都要过关

  • 一张多模态船票首先要求自研模型和公开可验证的能力;只有应用收入,也可能被下一轮模型升级吃掉。

  • 模型层竞争是耐力赛,但资本耐心有限

  • 2024—2025 年,一批视频创业公司批量退出牌桌

  • 一级与二级市场都在寻找模型排名、对标逻辑和增长数字,但对「新型 toB」的共同要求,是不要回到私有化部署和定制研发。

02:54:55 卖铲子给具身:从世界中学习,再重构世界

  • 智象与诺亦腾合作: 具身公司缺少高质量、可规模化的数据

  • 把真人遥操和夹爪数据扩增为不同背景、不同手部外观的第一人称视频

  • 合成数据是否「真实」并非重点,重点是它能否提升 VLA 或 World Action Model,并用轻量模型量化能力增量。

  • 通用世界模型仍缺数据、架构和算力,把触觉、温度、空间、时间、语言与动作放进同一模型,可能需要今天 10—100 倍的计算资源。

  • 图片是入口,视频是过程,世界模型是终局

  • 「我希望能够从世界中学习,把世界进行重构。」

---

欢迎前往视频版,对照字幕获得更好的吸收。也欢迎关注公众号「卫诗婕漫谈 Light the Star」,查看访谈文字版整理。

加入听友群、关注「漫谈 Light the Star」的全网账号 👇

展开Show Notes
晨煊-
晨煊-
12小时前
10:07 黄梅是很穷困的地方啊,记得 1996 年,我参与将互联网引入中国,我负责江西的 Chinanet 一期落地,在南昌郊区逛过已经荒芜多年的八大山人旧居,就一路向北,,又是旱路,又是水路,又是水灾淹过的路,到达江西最北边的九江,那里数据局长招待部直属设计院的方式就是带我坐船过长江到对面,就是湖北黄梅,真的是有点像西北,没有植被,只有土房子,村里包着孩子的妇女穿着破烂,从怀里掏出一叠黄盘😳😳。这是那个时代的特色,家庭刚开始有光碟播放机,那也是段永平刚开始生产 Goldstar 播放机,财富积累的最初阶段
卫诗婕_漫谈LTS
:
😯
晨煊-:一直很奇怪,长江两岸都是省里最边缘的地方。江西这边,九江是省里经济第二大城市,而对岸的黄梅好像湖北的三不管地带,上世纪 90 年代,农民还赤身露体
kiriding
kiriding
12小时前
🛋️
卫诗婕_漫谈LTS
:
好的研究人员的画像:看到别人发了牛 x论文,第一感觉是耻辱感,反问自己为什么没做出来。
卫诗婕_漫谈LTS
:
:)
deedeelitchi
deedeelitchi
7小时前
35:43 to b or not to b
卫诗婕_漫谈LTS
:
🤔
xkk7
xkk7
7小时前
来了💡
卫诗婕_漫谈LTS
:
梅院士分享的细致详尽,娓娓道来,深受启发。感谢诗婕很好的提问和追问。👍
君九九
君九九
3小时前
相较OpenAI的DALL·E,HiDream图像能力持平,性价比优势明显。核心亮点是实现图片无缝生成视频,形成完整创作链路,这也完美印证了嘉宾梅涛老师的先深耕二维图像、再拓展多模态的长期思路。 👍👍👍👍
嘉禾日上
嘉禾日上
4小时前
“我已经攀登过一座山峰,现在我愿意将身份清零,重新去攀登另一座高山。”
米君子
米君子
5小时前
2:28:58 2025年中国团队能靠短剧先把钱赚到手,HiDream帮了大忙。它把文字、画面、配音这些不同类型的信息捏合到一起处理,三五个成员的小团队,几天就能做完一部百分钟的短剧,不用砸大本钱,做出来的内容直接能上线变现,这就让技术落地变得特别实在。 👍🏻👍🏻👍🏻
咖小飞
咖小飞
5小时前
特别认同研发和工程必须融合,如果还分成两个独立团队,创业决策速度确实会远远落后大厂,这点说的特别透彻。
山间迟暮
山间迟暮
5小时前
高质量的一期,听着有一种沉静的力量感。果然嘉宾高度是不一样的,人如其名,梅院士说喜欢梅花,特别击中人心。
躺平的人
躺平的人
1 小时前
只有梅院士这种头部专家才能提出具身、世界模型这种前沿且充满未来感的概念,现在我们可能理解不了,感觉不切实际,但这些终将在未来实现
能听梅院士这种元祖级别的大师分享视频AI技术,真是三生有幸,荣幸之至。虽然有不少英文和术语没太听懂,但好在有很多形象的比喻,了解了大概意思,这项技术真的是意义非凡,对视频和影视业有巨大影响。