80.与梅涛院士的 3 小时访谈:语言、视频、具身终将汇聚,为什么是世界模型?
卫诗婕|商业漫谈Jane's talk

80.与梅涛院士的 3 小时访谈:语言、视频、具身终将汇聚,为什么是世界模型?

202分钟 9,764 5天前
节目简介
来源:小宇宙
从语言大模型,到多模态至全模态模型,再到走向世界模型…
世界正在经历什么?
本期节目我邀请了加拿大外籍院士、智象未来 Hidream的创始人梅涛,还原视频生成模型的技术发展史。
梅涛院士是全球首篇文生视频论文的作者,也是最早探索文生视频的人。
2026 年 5 月 20 日,Google I/O 大会上,Pichai 发布了 Gemini Omni —— Google 第一个原生「any-to-any」的全模态模型:文本、图像、视频、语音都在同一个 Transformer 里原生流动,不再是几个模型拼接——这与梅涛一直以来的主张不谋而合。
与此同时,OpenAI 悄悄砍掉了 Sora 项目,更多聚焦 Coding——硅谷正在做减法。
但中国一侧的多模态战场却没有收敛,从多模态、全模态到世界模型,多模的架构层面正在发生一轮新的分化:DIT、UIT、Omni 各自赌不同的路。
梅涛,作为最懂视频模型的人之一,正是选择从底层架构下场的创业者,他致力于打造「视频界的 Anthropic」。
我们从他的中科大、微软亚研院岁月,一路聊到这场世界模型的创业之旅。梅涛的模型世界观可以用一句话精炼,那就是:
图片是入口,视频是过程,世界模型是终局。
语言、视频、具身,终将汇聚。
这期的信息量极大,但技术门槛较高,不过,其中穿插着大量生动比喻,跟随下来,也能对当下的AI 趋势进行一场深入的了解。推荐大家收听~
本期嘉宾:梅涛(加拿大工程院外籍院士、智象未来 HiDream 创始人)
本期 Shownotes:
03:35 视频领域的 Anthropic :图片是刀, 视频是过程
* 学 Anthropic 的三件事: 团队从 OpenAI 出来后极度稳定(智象核心作者从 2017 年起就没走过一个)、坚定做企业服务、通过开源建立自我逼迫的创新节奏
* 视频领域的刀是图片 : 图片是二维/三维信号的入口,今天客户在平台上创作的时间 50%-60% 花在做一张图上
* 多模的成长路径:图片模型 → 视频模型 → 全模态模型 → 世界模型
* 能不能把图片做到全球最好,是视频公司真正的分水岭:Google 的 Veo 3 之所以强,是因为 Google 本身有很好的图片模型
08:25 院士里少有的「躬身入局」:全职 20 年的工业界履历
* 中科大→微软亚研 10 年→京东探索研究院 5 年→2023 年创立智象;从没拿过第二份薪水,始终全职
* 导师张宏江的习惯:看汇报从最后一页往前翻,5 分钟就把半小时的 slides 看完
* 「用 AI 分析理解视频」的任务,跨越 6 年才完成——多模态、全模态、世界模型都是那份实习任务的延长线
* 好的 mentor 给的 assignment 都不是「当下能做出来」的,而是「你的整条职业生涯都要围绕它推进」的
* 反人性才能获得长久的正反馈,负反馈也是正反馈
* 微软亚研院的土壤:这样的 R to D 通道今天几乎绝迹
29:00 微软 R&D 分离 vs OpenAI 融合:今天模型就是产品
* 微软时代:研究员做 paper → 10 个工程师转化成产品 → 100 个工程师做产品化,大半年才能进产品线
* OpenAI 这一代:researcher 和 engineer 完全融合,R&D 之间不再有转化层
* 研究员今天为什么这么贵——因为他们直接是产品线;研究判断本身就是产品判断
* 如果你的研究和工程仍是两个团队,你比大厂慢的不是资源,而是决策速度
31:27 AI 不是足球赛而是篮球比赛:第一节快结束了
* toC 是 toB 的放大器——C 端最先感知模型能力的溢出、贡献社区反馈、做 branding
* 中国 AI 创业的三个关键词:全球化、出海、软硬件一体
* AI 的四节比赛:大模型比拼、 agent(通用+垂直)、终端流量入口/软硬件、第四节待定
* AI 时代,toB 和 toC 的边界越来越模糊:创业公司不必二选一
* 后面的迭代周期会更短:基模半年一次大迭代,Agent 可能三个月一次,终端和交互还会更快
42:15 Sam vs Dario:一号位视角 vs 单点技术执念
* Dario 是理想主义者(读社会学、历史、哲学);Sam 是投资人出身,更现实
* 讲宏大叙事等不到爆发那天就会死
* 中国投资人的三重反射弧——需要沿途下蛋、追共识不追共识外、经历过 toC 时代所以对 toB 天花板有本能的低估——这些都改变了中国创业者能选的叙事结构:你必须在讲远期愿景的同时不断证明近期商业化
* 「长期看 Anthropic 和 OpenAI 的曲线一定会交织」
47:10 从 TGANs-C 到 UiT:做视频模型,创业公司为什么必须换架构
* 做出全球第一篇文生视频论文 TGANs-C (2017):使用 GAN 与卷积神经网络,只能生成约 3—4 秒、48×48 像素的模糊视频,但证明了文本可以反向生成视频
* 视频生成模型经历了 GAN、Diffusion、DiT 几轮架构变化:主干网络从 CNN 换成 Transformer 后,模型才获得更强的上下文和规模化能力
* DiT 需要先把文字、图片和视频压进隐空间,再编码、解码;压缩会损失细节,也让像素级控制变得困难——字节等大厂可以在此基础上大力出奇迹,但始终有些事做不到
* 智象在探索的UiT: 尝试取消外部 VAE,让原始像素、文本 Token 和任务条件进入统一空间,直接完成跨模态交互
* 创业公司必须思考如何避开大厂的车辙,如何优化成本曲线,逼近大厂的优势
* 「架构上的领先只能持续六个月」:开源是一场持续创新考试
* 为什么视频模型目前仍然是创业公司玩得起的游戏?千卡级训练仍给创业公司留有窗口
01:17:15 像素没有统计意义:多模态还在 GPT-2 阶段
* 语言是经过人类数千年压缩的结构化知识,而视觉信号缺少公认的 Token 定义,「像素没有统计意义」
* 文本可以用 next-token prediction 自监督训练,图像和视频通常需要成对的内容与高质量描述,监督成本更高
* 视觉 Scaling Law 会出现,但不一定复刻语言模型的路径;数据、算法和算力都还没有形成统一范式
* 目前视觉不负责产生智能,而在于复刻
* 多模态消耗数据的速度仍赶不上人类产生视觉数据的速度
01:27:50 世界模型不是一个模型:三条路还没有交汇
* 杨立昆的 JEPA 路线关注 next state 与世界状态预测;李飞飞更侧重 3D 世界重建;视频生成派则希望从海量真实视频中学习物理规律
* 视频模型的数据更通用、参数体量更大,可以成为世界模型的基础底座,再向具身或交互式任务迁移
* 图片、第三人称视频、第一人称视频和具身真机数据各自覆盖不同分布,单靠真机数据很难获得足够泛化
* 生成与理解目前仍是两套路线,真正的大一统架构尚未出现。
* 世界模型现阶段更像一组不同目标、数据和训练方式的模型家族。具身、3D 和视频都只是路径,过早把它们压成一个答案,会遮住真正的架构问题
01:41:16 从微软、京东到 HiDream:创业没有标准答案,在迷雾中寻找航向
* 通用视频模型底座的商业化
* 技术创业选赛道时,「未来足够大」还不够。能否沿途形成收入、数据和产品反馈,决定团队有没有机会等到终局。
* 判断模型是否真正创新,不能只看公开榜单;模型公司会用自己的测试集和极限 Prompt 检查边界能力。
* 好的 Leadership :清晰目标、可执行路径、利他和技术使命感
* 快速不仅指把正确路线跑快,也包括更早承认路线不对
02:08:53 通往世界模型:下一代架构可能已在萌芽
* 从多模态、全模态走向世界模型是通向 AGI 或 ASI 的必经阶段
* 当前的 Transformer 未必足以承载所有模态和交互,下一代架构可能已经在萌芽
* 让博士生和研究员持续筛论文、做小规模试错,再把有潜力的方向放大到产业级训练
* 发现下一代架构靠的不是一次灵感,而是一套持续感知机制
02:19:34 世界模型不等于具身:图片是扎马步,最大的数据量目前来自视频模型公司
* 自动驾驶、视频、3D 和机器人都有各自的世界模型叙事。
* 智象的「具身世界模型」路径:先把图片质量做高,再扩展视频长度、实时性和可交互性,最后延伸到高精度的物理世界任务。
* 「像智象这样的公司,一年都是 100 PB 级年度视频数据」:视频仍是当前最可规模化的物理世界信号
* 图片不是视频模型的过渡版本,而是最低成本的基本功测试——构图、像素控制和角色一致性做不稳,视频越长,错误只会被继续放大。
02:28:49 多模态商业化:智能未涌现,表现力先变现
* 「多模不会一家独大」
* Agent 的价值不只取决于基模,还取决于 Harness、Skills、成本控制和行业 know-how
* 多模态还没有出现语言模型式的智能涌现,却已经出现表现力涌现。商业化可以早于技术终局。
* 「Token 将来价值会越来越薄,因为它成为了一种 commodity。」
02:42:06 船票的本质:模型能力与商业化都要过关
* 一张多模态船票首先要求自研模型和公开可验证的能力;只有应用收入,也可能被下一轮模型升级吃掉。
* 模型层竞争是耐力赛,但资本耐心有限
* 2024—2025 年,一批视频创业公司批量退出牌桌
* 一级与二级市场都在寻找模型排名、对标逻辑和增长数字,但对「新型 toB」的共同要求,是不要回到私有化部署和定制研发。
02:54:55 卖铲子给具身:从世界中学习,再重构世界
* 智象与诺亦腾合作: 具身公司缺少高质量、可规模化的数据
* 把真人遥操和夹爪数据扩增为不同背景、不同手部外观的第一人称视频
* 合成数据是否「真实」并非重点,重点是它能否提升 VLA 或 World Action Model,并用轻量模型量化能力增量。
* 通用世界模型仍缺数据、架构和算力,把触觉、温度、空间、时间、语言与动作放进同一模型,可能需要今天 10—100 倍的计算资源。
* 图片是入口,视频是过程,世界模型是终局
* 「我希望能够从世界中学习,把世界进行重构。」
---
欢迎前往视频版,对照字幕获得更好的吸收。也欢迎关注公众号「卫诗婕漫谈 Light the Star」,查看访谈文字版整理。
加入听友群、关注「漫谈 Light the Star」的全网账号 👇

加入我们的 Discord

与播客爱好者一起交流

立即加入

扫描微信二维码

添加微信好友,获取更多播客资讯

微信二维码

播放列表

自动播放下一个

播放列表还是空的

去找些喜欢的节目添加进来吧