Album

卫诗婕|商业漫谈Jane's talk

努力做最有生命力的科技商业访谈。

卫诗婕_商业漫谈Jane 佚名 生活休闲 · 休闲
7.59万 订阅 83 集 3天前
播客简介
努力做最有生命力的科技商业访谈。 Let knowing flow. 卫诗婕:独立商业作者,曾任极客公园执行总编。早年就职于《人物》、GQ报道、字节跳动。虎嗅2024年度作者、金字节奖年度新锐作者、网易非虚构文学奖年度作者、全球真实故事奖TSA(True Story Award)中文报道十佳。 公众号:卫诗婕 商业漫谈 B站账号: 卫诗婕 商业漫谈 微博:诗婕SJ_Jelyne 小红书:诗婕Jane's talk 合作洽谈 👉 微信:SJ_Jelyne(添加请备注身份+事由) 读者互动,欢迎添加小助手微信:shangyemantan
节目
83.宇树上市:王兴兴的「幸运」,投资人的「教训」|对谈宇树早期投资人、初心资本田江川

83.宇树上市:王兴兴的「幸运」,投资人的「教训」|对谈宇树早期投资人、初心资本田江川

卫诗婕|商业漫谈Jane's talk

宇树科技正式敲钟上市了。 我曾在第 65 期节目(《除夕夜,与王兴兴的对谈》),于除夕夜春晚舞台演出之后,专访过宇树的创始人王兴兴。 那次对话的震撼一直持续至今。在我的认知里,宇树绝对不只是又一家把硬件卖到全球的成功企业。 它是一个真正能开启中国硬科技全新创新时代的范本。 宇树证明了:中国创业者能够用极致的工程创新、并将中国硬件的优势发挥到极致,从而做到引领全球;他们不需要光鲜的履历,就能让全球最顶尖的实验室基于中国团队的硬件去定义行业标准。 我们试图回到那个没有聚光灯、甚至充满偏见的起点。 我邀请了宇树的早期投资人、初心资本的管理创始人田江川,一起复盘了宇树这个项目所有的非共识。 如标题所说,早年融资上捉襟见肘,反而成了宇树最大的「幸运」;当年被顶级 VC 视作“短板”的草根背景、手搓 BP、不做视觉算法的王兴兴与宇树,最终却构筑了断代级的壁垒。 某种程度上,宇树和王兴兴实现了一次中国投资人们的集体认知升级——有关反精英主义的傲慢,与什么是真正的创新。 本期嘉宾:田江川(初心资本管理合伙人 、宇树早期投资人) 本期 Shownotes: 02:25 2015 & 2025 :投资的 vintage year * 乔布斯的「初学者心」:持续对世界保持热爱和好奇 * 2017 年,3000 万人民币估值的宇树 * 王兴兴 2019 年的 BP * 投资行业正不断回馈胆子大的人 * 2025 年技术变革中,话语权只掌握在少数人手里 00:07:22 2017,为何在Costa咖啡馆里错过了王兴兴? * 「让机器人走进千家万户」的 passion 打动了我 * 电机这个路径一定是更好 scale 的,但当时我没有意识到 * 宇树是Macintosh 级别的创新 * 人才策略的三星模型—— poor 、smile and desire * target mass market * 哪个年份的阿里人含金量最高? * “两真两网”体系:真问题、真专家、认知网络和信任协同网络 00:19:31 宇树不是一家机器人企业,它是一家全球性的生态平台 * 宇树的高毛利和量产能力从哪来? * 宇树如何站住了生态位?它的壁垒是什么? * 宇树的「幸运」:兴兴的英语是很不好的,但是day1 他就选择做海外 * 宇树其实是一家生态平台 * 「他们还会进入科研市场吗?其实很多是不会的了。」 * 「这么多岗位是谁在做?他当时说:是我。」 00:30:05 孤独的创新者:厚积薄发的六年 * 在一个无人区创新,即便不好走,但没有那么多竞争 * 宇树和大疆相似的成长路径 * 王兴兴给市场的强压迫感:一般都会早于市场 3-6 个月,推出一款别人赶不上的产品 * 2025 年春晚,中国具身行业的分水岭 00:53:55 人才审美:极客、科技理想主义者,与清醒的野心 * 所有 10 倍的优势,都是非常了不起的信号 * “A user is a player.” * 点亮宇宙科技之树 * RoboMaster,是培育大疆竞争对手最大的温床 * 「三非」:扶持非共识、非中庸、非主流创业者 01:15:57 具身智能布局:这个时代的船票只属于少数人 * 中国具身的红利 * ToC 端未形成 PMF 的核心原因:核心技术不到位,目前仅能提供情绪价值 * 具身领域存在类似 SaaS 的确定性机会 * 硬件赛道更离散,行业有巨大增量 * 地缘政治的最大挑战 01:36:59 MIT 的冲击与 VC 行业的残酷法则 * 管理是一门科学而非艺术 * 「裸奔做一个 CEO」 * 理解了文化差异,就能理解中美为什么会脱钩 * 天赋与勤奋:「今天你因为要出去滑雪,你就错过了字节」 * 创新的根本,就是顶级人才的流动 加入听友群⬇️:

115分钟
25k+
3天前
82.具身是一场马拉松,VLA 和世界模型都不够本质|一个华为天才少年的具身启航

82.具身是一场马拉松,VLA 和世界模型都不够本质|一个华为天才少年的具身启航

卫诗婕|商业漫谈Jane's talk

这是一个在 2026 年才正式浮出水面的具身明星项目。 墨奇智能成立于 2025 年底,半年内完成超过 10 亿元天使轮融资。创始人黄青虬是前「华为天才少年」,亲历华为智能驾驶从 0 到 1 、从第一代到第四代的完整建设,离职前,他领导 200 余人团队,时任AI 模型开发部部长,并把端到端方案推向量产。 从去年年底开始,这个项目是具身领域投资人们纷纷约见和抢注的对象。 从本科、博士到华为工作,黄青虬完整经历了机器人的小脑、大脑及系统的学习、探索和实践。其中穿插着清华火神队、汤晓鸥成立的 MMLab 以及华为自动驾驶,这些人工智能的传奇之地。 这是一期信息量很高的访谈。它能解答一个问题:为什么在 2026 年,具身浪潮已经狂飙了三年、全行业有数百家具身企业之后,这个赛道仍然有新选手的机会。 要点概览: • 具身是马拉松,不需要弯道超车。 • 具身量产需要更严格的定义。今年能产出 5000 台靠谱机器人的公司,不会超过三家。 • 数据的质量,远远重要于数量——在一个人人都高喊「1000 万小时」「1 亿小时」数据的时刻,黄青虬认为,今天行业接触到的具身数据「质量是不够高的」,且缺乏统一的标准。 • VLA 和世界模型是一体两面,但它们都「不本质」。 视频版将在 8.4 日中午上线各大平台:b 站、微博、小红书、视频号等,欢迎前往:) 本期嘉宾: 黄青虬 ( 墨奇智能联合创始人兼 CTO , ex 华为天才少年) 本期 Shownotes: 05:36 最晚下场的「华为天才少年」,与具身爆发的节点:2026 才出发,晚了吗? * 大模型从 chatbot 发展为 coding 、agent 成熟 * 智驾领域实现可泛化、可大规模商用的端到端一段式控制技术 * 批量具身公司出现,具身创业门槛不高? * 「投资人可能默认我能做成」 11:34 具身是一场马拉松,不是百米冲刺:起点差几个身位,没有太大的区别 * 技术范式未收敛,所以起点不重要 * 行业热度高,人才分散浮躁——这个领域需要怎样的人才画像? * 太多人谈弯道超车,什么是这个行业真正的基本功?硬件可靠性、算法数据模块的精度效率是「苦活累活」 19:20 路线选择:toC 一定是终点,但可以先把 toB 当跳板 * 场景选择:可泛化、可分阶段落地、能够回流高价值数据以迭代通用模型 * 具身行业的数据质量很成问题 * 好数据的三个条件 * 「具身的 Scaling Law 会比大语言模型更难 」 * 具身模型存在模型结构的矛盾,挑战很大 29:28 算法不重要?「算法是这一轮智能的核心」 * 算法架构是容易抄的,但探索过程中积累的方法、人才、组织氛围无法复刻 * 成立仅半年,月算力投入达千万级,算力投入可排行业前五 * 「这个行业的算力投入与行业热度,是不匹配的」 * 大脑的算力门槛为千卡级别,要出突破性成则果需达万卡级别 36:58 机器人兴趣:从《铁甲小宝》、《黑客帝国》,到清华火神队 * 赵明国老师的清华 508 实验室 * 「不要随大流,要有自己相信的研究方向」 * 运控古典派如何看待宇树:Sim-to-Real 最小背后,硬件一致性与参数整定 * 细节决定成败:负载系统会放大误差难以溯源 53:24 从机器人「小脑」到「大脑」:传奇 MMLab 带来的一切 * 初识 CV:恰逢 ImageNet 诞生,多模态理解一定是大势 * 商汤往事:在文津国际公寓的岁月 * 汤晓鸥强调的「黑羊文化」 * 从封闭式走向开放式的命题:重新定义系统 * 什么是具身大脑的核心? * 通用的「特征提取」 * 什么是好的系统? 01:17:11 加入华为:「华为天才少年」、救火、与自动驾驶的四代更迭 * 「华为天才少年」打破了外界对华为的刻板印象 * 「银狐」量产救火:从没上手过激光雷达,却完成了算法修复,怎么做到的? * 什么是可迁移的经验?如何迁移? * 从六七人扩张到200人的管理与文化:同理心是关键,找寻一致的人 * 什么是真正的财富?地狱级的量产有更严苛的标准,刷榜没有意义 01:36:03 「VLA 和世界模型,都不够本质」 * 为什么会出现各类技术方向:具身模型动作模态稀疏、反馈少、训练慢 * VLA 和世界模型是一体两面:都是为了将模态从稀疏推向稠密 * AI 仍是一门实验科学,需要大量验证试错 * 华为自动驾驶 4.0 量产完成,我从华为「毕业」了 * 如何做技术选择?「美的东西,都是简洁的(Simple but work)」 02:00:07 量产的定义需要更严格:不能做到 7✖️24 小时运转,每一台机器人保持一致,就是原型机! * 中国做硬件、硅谷出软件(大脑)的故事几乎不会重演:具身的数据是要从头来过的 * 「ChatGPT 的 changing point ,只是刚好出现在 OpenAI」 * 每次推倒重来,才有机会提升智能的上限 * 「我对量产的定义可能更严格」「我希望做一家靠谱的公司」 * 「今年能产 5000 台靠谱机器的公司,不会超过三家」 02:09:32 豪华团队:追求「温柔与坚定」,有趣也很重要! * 具身很复杂,「你永远不知道会出什么幺蛾子,需要非常健康的心态去看待这些状况」 * 工程很重要,学术 taste 也很重要 * 做机器人很苦:产品和团队的调性会影响心情,心情又会影响灵感 * 乐观是一种可被习得和塑造的方法 * 「看一看表,还有二十几年——是时候开始做了」 加入听友群⬇️

146分钟
19k+
2周前
81.Agent Infra,巨头都在布局的隐秘赛道|与百度王雁鹏聊模型、智能体与 AI 基建的新动向

81.Agent Infra,巨头都在布局的隐秘赛道|与百度王雁鹏聊模型、智能体与 AI 基建的新动向

卫诗婕|商业漫谈Jane's talk

我们正经历从模型时代到 Agent 时代的过渡。 底层技术正在发生怎样的演变,有哪些硅谷与国内的重要 AI 趋势?为什么这是工程师最好的时代? 这期播客,我邀请了百度智能云AI 计算首席科学家王雁鹏,深入探讨 Agent Infra 这个重要的「隐秘战场」。 (本期视频版也已上线:欢迎前往 b 站、视频号、小红书等平台观看~) 本期嘉宾:王雁鹏(百度智能云 AI 计算 首席科学家) 本期 Shownotes: 01:46 模型动向、AI 基建正在发生什么? * 什么是 AI Infra?「Infra 其实就是抽象一个层次,这个层次有足够的通用性。」 * AI Infra 为什么从软件走向软硬一体?「前一代的 Infra 基本上全是软件视角,这一代 AI Infra 有一个巨大的区别:它是以 GPU 为核心构建的。」 * GPU 极大释放了算力,但是牺牲了通用性 * 从 AI Infra 到 Agent Infra ,意味着什么?「完成真实任务意味着我得有一个完整的环境,人操作的所有基础设施和软件,都要被 agent、被 AI 去用。」 04:25 Agent 从 demo 走向生产环境,还差什么? * Agent 的三阶段 —— 从 Chat 到「完成岗位」的鸿沟 * 模型能力边界,决定 Infra 抽象层在哪里 * 新时代的数据库是什么,memory 系统长什么样,还在变化 * 模型的智力等于算力,算力等于电力 * Agent 可控、可信任:每一次执行结果不变、可重复 * 基础设施层面,需要构建一套能够快速部署、快速开发、大规模运行的系统,一个更强的推理集群 12:03 OpenClaw、Hermes 与 Agent harness 的范式变化 * 「Claude 4.5 出来时,程序员圈已经被震撼过一波」 * 「Openclaw 第一眼没什么特别,再看还是有点东西」 * harness 的三件套:loop(主循环) + tools(调用工具) + memory(记忆系统) * loop 的通用性极强 :「让大模型看上一步结果 → 分析问题 → 决定下一步 → check 是否达标」 * Memory 从 RAG 演进到文件系统:更通用 * Hermes 的更进一步 —— 自动净化 skills(定期反思:这个任务哪里不好、下次怎么做更好、整理成明天可用的 skill) 18:44 模型即 OS :大家争夺的都是超级入口 * 为什么 agent 会越来越多:大模型以后会是 OS,是大脑 * 通用大脑就像天才:可以做任何事,但不会 day1 就能做任何事,中间的学习成本 + knowhow 沉淀 = 应用层的价值 * Agent 的三大支柱:长上下文冲击算力、存储、网络与 CPU 消耗 * CPU 的消耗,可以窥见 Agent 诞生了多少真实价值 * 「这仍然是巨头的游戏」 * 为什么英伟达的生态很难撼动? 36:42 Agent Infra,巨头都在布局的最吸金、最隐秘的赛道 * 智能 = 算力 = 生产资料 * 「所有巨头都会往下做垂直整合」 * Anthropic、OpenAI、Google 的 Infra 路线差异: 谷歌,最典型的垂直整合派:TPU 做了近 10 年、JAX 自研、Infra 自研、模型自研 —— 芯 、 云 、 模真正一体化 Nvidia:不再是芯片公司,而是系统公司 Anthropic(轻资产,聚焦入口派):聚焦模型 + Claude Code 这个高价值入口;算力靠跟 AWS / Google 签协议保障,短期不用自己造芯片 * OpenAI(重资产,生态平台派):「从 GPT Store 那时就想做 App Store 式生态」; * 垂直整合的隐藏难点:「软件世界与硬件世界有 gap」 * 「今天定义的芯片两年半后出来时,还是不是那个模型需求?很大程度上不是」 * NV 的缝隙在推理系统 51:19中国 Infra 路径:多芯适配、开源生态 * 国内 vs 国外 Infra 的两大差异: 芯片环境不一样:国外主要在 NV 生态;国内要考虑国产芯片、要做更多多芯适配 中国的开源远远领先于美国 —— 开源意味着**模型架构透明**,做芯片的能知道往哪里走 * 百度智能云的两个押注:更高的算力与 Token 效率 + 和未来的新星走在一起 * Robin(李彦宏)提出的新指标 DAA(Daily Active Agents) —— 替代 Token 数量作为 Infra 层的牵引指标 * 「Token 数是一个会被玩坏的指标」:不能做杀鸡取卵的事 * 提升 DAA 的路径:**让开发更快** + 让运行更稳(可自动恢复、结果可 check) + 分任务价值高低(高价值多花功夫做) * 趋势:从 Token 到 DAA :Agent 时代需要更多衡量真实价值 * 提升 DAA 的路径:让开发更快 + 让运行更稳(可自动恢复、结果可 check) + 分任务价值高低(高价值多花功夫做) 01:00:22 为什么这是工程师更好的时代 ? * 更大的探索空间:做 Infra 的人在 CPU 时代不会在芯片层面想工作;到 AI 时代能做很多系统层面的事;到 Agent 时代要做更不一样的系统 * 当下,整个研究范式都在工程化: 「工程化研究范式」是这一代 AI 的隐藏画像 * Transformer 架构统一之后,各家拼的其实是工程能力 * 「算法工程师」的时代结束了,「AI 系统工程师」的时代开始了 * 「今天你用工程的方法去解决更多、更广泛、更复杂的问题」 加入听友群⬇️:

63分钟
20k+
3周前
80.与梅涛院士的 3 小时访谈:语言、视频、具身终将汇聚,为什么是世界模型?

80.与梅涛院士的 3 小时访谈:语言、视频、具身终将汇聚,为什么是世界模型?

卫诗婕|商业漫谈Jane's talk

从语言大模型,到多模态至全模态模型,再到走向世界模型… 世界正在经历什么? 本期节目我邀请了加拿大外籍院士、智象未来 Hidream的创始人梅涛,还原视频生成模型的技术发展史。 梅涛院士是全球首篇文生视频论文的作者,也是最早探索文生视频的人。 2026 年 5 月 20 日,Google I/O 大会上,Pichai 发布了 Gemini Omni —— Google 第一个原生「any-to-any」的全模态模型:文本、图像、视频、语音都在同一个 Transformer 里原生流动,不再是几个模型拼接——这与梅涛一直以来的主张不谋而合。 与此同时,OpenAI 悄悄砍掉了 Sora 项目,更多聚焦 Coding——硅谷正在做减法。 但中国一侧的多模态战场却没有收敛,从多模态、全模态到世界模型,多模的架构层面正在发生一轮新的分化:DIT、UIT、Omni 各自赌不同的路。 梅涛,作为最懂视频模型的人之一,正是选择从底层架构下场的创业者,他致力于打造「视频界的 Anthropic」。 我们从他的中科大、微软亚研院岁月,一路聊到这场世界模型的创业之旅。梅涛的模型世界观可以用一句话精炼,那就是: 图片是入口,视频是过程,世界模型是终局。 语言、视频、具身,终将汇聚。 这期的信息量极大,但技术门槛较高,不过,其中穿插着大量生动比喻,跟随下来,也能对当下的AI 趋势进行一场深入的了解。推荐大家收听~ 本期嘉宾:梅涛(加拿大工程院外籍院士、智象未来 HiDream 创始人) 本期 Shownotes: 03:35 视频领域的 Anthropic :图片是刀, 视频是过程 * 学 Anthropic 的三件事: 团队从 OpenAI 出来后极度稳定(智象核心作者从 2017 年起就没走过一个)、坚定做企业服务、通过开源建立自我逼迫的创新节奏 * 视频领域的刀是图片 : 图片是二维/三维信号的入口,今天客户在平台上创作的时间 50%-60% 花在做一张图上 * 多模的成长路径:图片模型 → 视频模型 → 全模态模型 → 世界模型 * 能不能把图片做到全球最好,是视频公司真正的分水岭:Google 的 Veo 3 之所以强,是因为 Google 本身有很好的图片模型 08:25 院士里少有的「躬身入局」:全职 20 年的工业界履历 * 中科大→微软亚研 10 年→京东探索研究院 5 年→2023 年创立智象;从没拿过第二份薪水,始终全职 * 导师张宏江的习惯:看汇报从最后一页往前翻,5 分钟就把半小时的 slides 看完 * 「用 AI 分析理解视频」的任务,跨越 6 年才完成——多模态、全模态、世界模型都是那份实习任务的延长线 * 好的 mentor 给的 assignment 都不是「当下能做出来」的,而是「你的整条职业生涯都要围绕它推进」的 * 反人性才能获得长久的正反馈,负反馈也是正反馈 * 微软亚研院的土壤:这样的 R to D 通道今天几乎绝迹 29:00 微软 R&D 分离 vs OpenAI 融合:今天模型就是产品 * 微软时代:研究员做 paper → 10 个工程师转化成产品 → 100 个工程师做产品化,大半年才能进产品线 * OpenAI 这一代:researcher 和 engineer 完全融合,R&D 之间不再有转化层 * 研究员今天为什么这么贵——因为他们直接是产品线;研究判断本身就是产品判断 * 如果你的研究和工程仍是两个团队,你比大厂慢的不是资源,而是决策速度 31:27 AI 不是足球赛而是篮球比赛:第一节快结束了 * toC 是 toB 的放大器——C 端最先感知模型能力的溢出、贡献社区反馈、做 branding * 中国 AI 创业的三个关键词:全球化、出海、软硬件一体 * AI 的四节比赛:大模型比拼、 agent(通用+垂直)、终端流量入口/软硬件、第四节待定 * AI 时代,toB 和 toC 的边界越来越模糊:创业公司不必二选一 * 后面的迭代周期会更短:基模半年一次大迭代,Agent 可能三个月一次,终端和交互还会更快 42:15 Sam vs Dario:一号位视角 vs 单点技术执念 * Dario 是理想主义者(读社会学、历史、哲学);Sam 是投资人出身,更现实 * 讲宏大叙事等不到爆发那天就会死 * 中国投资人的三重反射弧——需要沿途下蛋、追共识不追共识外、经历过 toC 时代所以对 toB 天花板有本能的低估——这些都改变了中国创业者能选的叙事结构:你必须在讲远期愿景的同时不断证明近期商业化 * 「长期看 Anthropic 和 OpenAI 的曲线一定会交织」 47:10 从 TGANs-C 到 UiT:做视频模型,创业公司为什么必须换架构 * 做出全球第一篇文生视频论文 TGANs-C (2017):使用 GAN 与卷积神经网络,只能生成约 3—4 秒、48×48 像素的模糊视频,但证明了文本可以反向生成视频 * 视频生成模型经历了 GAN、Diffusion、DiT 几轮架构变化:主干网络从 CNN 换成 Transformer 后,模型才获得更强的上下文和规模化能力 * DiT 需要先把文字、图片和视频压进隐空间,再编码、解码;压缩会损失细节,也让像素级控制变得困难——字节等大厂可以在此基础上大力出奇迹,但始终有些事做不到 * 智象在探索的UiT: 尝试取消外部 VAE,让原始像素、文本 Token 和任务条件进入统一空间,直接完成跨模态交互 * 创业公司必须思考如何避开大厂的车辙,如何优化成本曲线,逼近大厂的优势 * 「架构上的领先只能持续六个月」:开源是一场持续创新考试 * 为什么视频模型目前仍然是创业公司玩得起的游戏?千卡级训练仍给创业公司留有窗口 01:17:15 像素没有统计意义:多模态还在 GPT-2 阶段 * 语言是经过人类数千年压缩的结构化知识,而视觉信号缺少公认的 Token 定义,「像素没有统计意义」 * 文本可以用 next-token prediction 自监督训练,图像和视频通常需要成对的内容与高质量描述,监督成本更高 * 视觉 Scaling Law 会出现,但不一定复刻语言模型的路径;数据、算法和算力都还没有形成统一范式 * 目前视觉不负责产生智能,而在于复刻 * 多模态消耗数据的速度仍赶不上人类产生视觉数据的速度 01:27:50 世界模型不是一个模型:三条路还没有交汇 * 杨立昆的 JEPA 路线关注 next state 与世界状态预测;李飞飞更侧重 3D 世界重建;视频生成派则希望从海量真实视频中学习物理规律 * 视频模型的数据更通用、参数体量更大,可以成为世界模型的基础底座,再向具身或交互式任务迁移 * 图片、第三人称视频、第一人称视频和具身真机数据各自覆盖不同分布,单靠真机数据很难获得足够泛化 * 生成与理解目前仍是两套路线,真正的大一统架构尚未出现。 * 世界模型现阶段更像一组不同目标、数据和训练方式的模型家族。具身、3D 和视频都只是路径,过早把它们压成一个答案,会遮住真正的架构问题 01:41:16 从微软、京东到 HiDream:创业没有标准答案,在迷雾中寻找航向 * 通用视频模型底座的商业化 * 技术创业选赛道时,「未来足够大」还不够。能否沿途形成收入、数据和产品反馈,决定团队有没有机会等到终局。 * 判断模型是否真正创新,不能只看公开榜单;模型公司会用自己的测试集和极限 Prompt 检查边界能力。 * 好的 Leadership :清晰目标、可执行路径、利他和技术使命感 * 快速不仅指把正确路线跑快,也包括更早承认路线不对 02:08:53 通往世界模型:下一代架构可能已在萌芽 * 从多模态、全模态走向世界模型是通向 AGI 或 ASI 的必经阶段 * 当前的 Transformer 未必足以承载所有模态和交互,下一代架构可能已经在萌芽 * 让博士生和研究员持续筛论文、做小规模试错,再把有潜力的方向放大到产业级训练 * 发现下一代架构靠的不是一次灵感,而是一套持续感知机制 02:19:34 世界模型不等于具身:图片是扎马步,最大的数据量目前来自视频模型公司 * 自动驾驶、视频、3D 和机器人都有各自的世界模型叙事。 * 智象的「具身世界模型」路径:先把图片质量做高,再扩展视频长度、实时性和可交互性,最后延伸到高精度的物理世界任务。 * 「像智象这样的公司,一年都是 100 PB 级年度视频数据」:视频仍是当前最可规模化的物理世界信号 * 图片不是视频模型的过渡版本,而是最低成本的基本功测试——构图、像素控制和角色一致性做不稳,视频越长,错误只会被继续放大。 02:28:49 多模态商业化:智能未涌现,表现力先变现 * 「多模不会一家独大」 * Agent 的价值不只取决于基模,还取决于 Harness、Skills、成本控制和行业 know-how * 多模态还没有出现语言模型式的智能涌现,却已经出现表现力涌现。商业化可以早于技术终局。 * 「Token 将来价值会越来越薄,因为它成为了一种 commodity。」 02:42:06 船票的本质:模型能力与商业化都要过关 * 一张多模态船票首先要求自研模型和公开可验证的能力;只有应用收入,也可能被下一轮模型升级吃掉。 * 模型层竞争是耐力赛,但资本耐心有限 * 2024—2025 年,一批视频创业公司批量退出牌桌 * 一级与二级市场都在寻找模型排名、对标逻辑和增长数字,但对「新型 toB」的共同要求,是不要回到私有化部署和定制研发。 02:54:55 卖铲子给具身:从世界中学习,再重构世界 * 智象与诺亦腾合作: 具身公司缺少高质量、可规模化的数据 * 把真人遥操和夹爪数据扩增为不同背景、不同手部外观的第一人称视频 * 合成数据是否「真实」并非重点,重点是它能否提升 VLA 或 World Action Model,并用轻量模型量化能力增量。 * 通用世界模型仍缺数据、架构和算力,把触觉、温度、空间、时间、语言与动作放进同一模型,可能需要今天 10—100 倍的计算资源。 * 图片是入口,视频是过程,世界模型是终局 * 「我希望能够从世界中学习,把世界进行重构。」 --- 欢迎前往视频版,对照字幕获得更好的吸收。也欢迎关注公众号「卫诗婕漫谈 Light the Star」,查看访谈文字版整理。 加入听友群、关注「漫谈 Light the Star」的全网账号 👇

202分钟
19k+
4周前
评价

空空如也

加入我们的 Discord

与播客爱好者一起交流

立即加入

扫描微信二维码

添加微信好友,获取更多播客资讯

微信二维码

播放列表

自动播放下一个

播放列表还是空的

去找些喜欢的节目添加进来吧