
从语言大模型,到多模态至全模态模型,再到走向世界模型…
世界正在经历什么?
本期节目我邀请了加拿大外籍院士、智象未来 Hidream的创始人梅涛,还原视频生成模型的技术发展史。
梅涛院士是全球首篇文生视频论文的作者,也是最早探索文生视频的人。
2026 年 5 月 20 日,Google I/O 大会上,Pichai 发布了 Gemini Omni —— Google 第一个原生「any-to-any」的全模态模型:文本、图像、视频、语音都在同一个 Transformer 里原生流动,不再是几个模型拼接——这与梅涛一直以来的主张不谋而合。
与此同时,OpenAI 悄悄砍掉了 Sora 项目,更多聚焦 Coding——硅谷正在做减法。
但中国一侧的多模态战场却没有收敛,从多模态、全模态到世界模型,多模的架构层面正在发生一轮新的分化:DIT、UIT、Omni 各自赌不同的路。
梅涛,作为最懂视频模型的人之一,正是选择从底层架构下场的创业者,他致力于打造「视频界的 Anthropic」。
我们从他的中科大、微软亚研院岁月,一路聊到这场世界模型的创业之旅。梅涛的模型世界观可以用一句话精炼,那就是:
图片是入口,视频是过程,世界模型是终局。
语言、视频、具身,终将汇聚。
这期的信息量极大,但技术门槛较高,不过,其中穿插着大量生动比喻,跟随下来,也能对当下的AI 趋势进行一场深入的了解。推荐大家收听~

本期嘉宾:梅涛(加拿大工程院外籍院士、智象未来 HiDream 创始人)
本期 Shownotes:
视频领域的 Anthropic :图片是刀, 视频是过程
学 Anthropic 的三件事: 团队从 OpenAI 出来后极度稳定(智象核心作者从 2017 年起就没走过一个)、坚定做企业服务、通过开源建立自我逼迫的创新节奏
视频领域的刀是图片 : 图片是二维/三维信号的入口,今天客户在平台上创作的时间 50%-60% 花在做一张图上
多模的成长路径:图片模型 → 视频模型 → 全模态模型 → 世界模型
能不能把图片做到全球最好,是视频公司真正的分水岭:Google 的 Veo 3 之所以强,是因为 Google 本身有很好的图片模型
院士里少有的「躬身入局」:全职 20 年的工业界履历
中科大→微软亚研 10 年→京东探索研究院 5 年→2023 年创立智象;从没拿过第二份薪水,始终全职
导师张宏江的习惯:看汇报从最后一页往前翻,5 分钟就把半小时的 slides 看完
「用 AI 分析理解视频」的任务,跨越 6 年才完成——多模态、全模态、世界模型都是那份实习任务的延长线
好的 mentor 给的 assignment 都不是「当下能做出来」的,而是「你的整条职业生涯都要围绕它推进」的
反人性才能获得长久的正反馈,负反馈也是正反馈
微软亚研院的土壤:这样的 R to D 通道今天几乎绝迹
微软 R&D 分离 vs OpenAI 融合:今天模型就是产品
微软时代:研究员做 paper → 10 个工程师转化成产品 → 100 个工程师做产品化,大半年才能进产品线
OpenAI 这一代:researcher 和 engineer 完全融合,R&D 之间不再有转化层
研究员今天为什么这么贵——因为他们直接是产品线;研究判断本身就是产品判断
如果你的研究和工程仍是两个团队,你比大厂慢的不是资源,而是决策速度
AI 不是足球赛而是篮球比赛:第一节快结束了
toC 是 toB 的放大器——C 端最先感知模型能力的溢出、贡献社区反馈、做 branding
中国 AI 创业的三个关键词:全球化、出海、软硬件一体
AI 的四节比赛:大模型比拼、 agent(通用+垂直)、终端流量入口/软硬件、第四节待定
AI 时代,toB 和 toC 的边界越来越模糊:创业公司不必二选一
后面的迭代周期会更短:基模半年一次大迭代,Agent 可能三个月一次,终端和交互还会更快
Sam vs Dario:一号位视角 vs 单点技术执念
Dario 是理想主义者(读社会学、历史、哲学);Sam 是投资人出身,更现实
讲宏大叙事等不到爆发那天就会死
中国投资人的三重反射弧——需要沿途下蛋、追共识不追共识外、经历过 toC 时代所以对 toB 天花板有本能的低估——这些都改变了中国创业者能选的叙事结构:你必须在讲远期愿景的同时不断证明近期商业化
「长期看 Anthropic 和 OpenAI 的曲线一定会交织」
从 TGANs-C 到 UiT:做视频模型,创业公司为什么必须换架构
做出全球第一篇文生视频论文 TGANs-C (2017):使用 GAN 与卷积神经网络,只能生成约 3—4 秒、48×48 像素的模糊视频,但证明了文本可以反向生成视频
视频生成模型经历了 GAN、Diffusion、DiT 几轮架构变化:主干网络从 CNN 换成 Transformer 后,模型才获得更强的上下文和规模化能力
DiT 需要先把文字、图片和视频压进隐空间,再编码、解码;压缩会损失细节,也让像素级控制变得困难——字节等大厂可以在此基础上大力出奇迹,但始终有些事做不到
智象在探索的UiT: 尝试取消外部 VAE,让原始像素、文本 Token 和任务条件进入统一空间,直接完成跨模态交互
创业公司必须思考如何避开大厂的车辙,如何优化成本曲线,逼近大厂的优势
「架构上的领先只能持续六个月」:开源是一场持续创新考试
为什么视频模型目前仍然是创业公司玩得起的游戏?千卡级训练仍给创业公司留有窗口
像素没有统计意义:多模态还在 GPT-2 阶段
语言是经过人类数千年压缩的结构化知识,而视觉信号缺少公认的 Token 定义,「像素没有统计意义」
文本可以用 next-token prediction 自监督训练,图像和视频通常需要成对的内容与高质量描述,监督成本更高
视觉 Scaling Law 会出现,但不一定复刻语言模型的路径;数据、算法和算力都还没有形成统一范式
目前视觉不负责产生智能,而在于复刻
多模态消耗数据的速度仍赶不上人类产生视觉数据的速度
世界模型不是一个模型:三条路还没有交汇
杨立昆的 JEPA 路线关注 next state 与世界状态预测;李飞飞更侧重 3D 世界重建;视频生成派则希望从海量真实视频中学习物理规律
视频模型的数据更通用、参数体量更大,可以成为世界模型的基础底座,再向具身或交互式任务迁移
图片、第三人称视频、第一人称视频和具身真机数据各自覆盖不同分布,单靠真机数据很难获得足够泛化
生成与理解目前仍是两套路线,真正的大一统架构尚未出现。
世界模型现阶段更像一组不同目标、数据和训练方式的模型家族。具身、3D 和视频都只是路径,过早把它们压成一个答案,会遮住真正的架构问题
从微软、京东到 HiDream:创业没有标准答案,在迷雾中寻找航向
通用视频模型底座的商业化
技术创业选赛道时,「未来足够大」还不够。能否沿途形成收入、数据和产品反馈,决定团队有没有机会等到终局。
判断模型是否真正创新,不能只看公开榜单;模型公司会用自己的测试集和极限 Prompt 检查边界能力。
好的 Leadership :清晰目标、可执行路径、利他和技术使命感
快速不仅指把正确路线跑快,也包括更早承认路线不对
通往世界模型:下一代架构可能已在萌芽
从多模态、全模态走向世界模型是通向 AGI 或 ASI 的必经阶段
当前的 Transformer 未必足以承载所有模态和交互,下一代架构可能已经在萌芽
让博士生和研究员持续筛论文、做小规模试错,再把有潜力的方向放大到产业级训练
发现下一代架构靠的不是一次灵感,而是一套持续感知机制
世界模型不等于具身:图片是扎马步,最大的数据量目前来自视频模型公司
自动驾驶、视频、3D 和机器人都有各自的世界模型叙事。
智象的「具身世界模型」路径:先把图片质量做高,再扩展视频长度、实时性和可交互性,最后延伸到高精度的物理世界任务。
「像智象这样的公司,一年都是 100 PB 级年度视频数据」:视频仍是当前最可规模化的物理世界信号
图片不是视频模型的过渡版本,而是最低成本的基本功测试——构图、像素控制和角色一致性做不稳,视频越长,错误只会被继续放大。
多模态商业化:智能未涌现,表现力先变现
「多模不会一家独大」
Agent 的价值不只取决于基模,还取决于 Harness、Skills、成本控制和行业 know-how
多模态还没有出现语言模型式的智能涌现,却已经出现表现力涌现。商业化可以早于技术终局。
「Token 将来价值会越来越薄,因为它成为了一种 commodity。」
船票的本质:模型能力与商业化都要过关
一张多模态船票首先要求自研模型和公开可验证的能力;只有应用收入,也可能被下一轮模型升级吃掉。
模型层竞争是耐力赛,但资本耐心有限
2024—2025 年,一批视频创业公司批量退出牌桌
一级与二级市场都在寻找模型排名、对标逻辑和增长数字,但对「新型 toB」的共同要求,是不要回到私有化部署和定制研发。
卖铲子给具身:从世界中学习,再重构世界
智象与诺亦腾合作: 具身公司缺少高质量、可规模化的数据
把真人遥操和夹爪数据扩增为不同背景、不同手部外观的第一人称视频
合成数据是否「真实」并非重点,重点是它能否提升 VLA 或 World Action Model,并用轻量模型量化能力增量。
通用世界模型仍缺数据、架构和算力,把触觉、温度、空间、时间、语言与动作放进同一模型,可能需要今天 10—100 倍的计算资源。
图片是入口,视频是过程,世界模型是终局
「我希望能够从世界中学习,把世界进行重构。」
---
欢迎前往视频版,对照字幕获得更好的吸收。也欢迎关注公众号「卫诗婕漫谈 Light the Star」,查看访谈文字版整理。
加入听友群、关注「漫谈 Light the Star」的全网账号 👇


