Album

卫诗婕|商业漫谈Jane's talk

努力做最有生命力的科技商业访谈。

卫诗婕_商业漫谈Jane 佚名
7.21万 订阅 79 集 6天前
播客简介
努力做最有生命力的科技商业访谈。 Let knowing flow. 卫诗婕:独立商业作者,曾任极客公园执行总编。早年就职于《人物》、GQ报道、字节跳动。虎嗅2024年度作者、金字节奖年度新锐作者、网易非虚构文学奖年度作者、全球真实故事奖TSA(True Story Award)中文报道十佳。 公众号:卫诗婕 商业漫谈 B站账号: 卫诗婕 商业漫谈 微博:诗婕SJ_Jelyne 小红书:诗婕Jane's talk 合作洽谈 👉 微信:SJ_Jelyne(添加请备注身份+事由) 读者互动,欢迎添加小助手微信:shangyemantan
节目
79.机器人大脑第一股上市,与仙工赵越的4小时访谈:全球第一、机器人金字塔与具身智能的另一条路

79.机器人大脑第一股上市,与仙工赵越的4小时访谈:全球第一、机器人金字塔与具身智能的另一条路

卫诗婕|商业漫谈Jane's talk

这是一期非常生动、系统的访谈,还原了一家隐形冠军的成长史与思维方式。 作为机器人大脑第一股(仙工智能已于2026年6月24日在香港交易所主板挂牌上市),仙工把机器人的大脑「控制器」卖向全球,成为全球出货量第一。同时,它也正在探索一条反主流叙事的具身大脑道路。 这是仙工成立以来及上市后,创始人首次接受深度深度访谈。此前,这家公司作风低调,鲜有接受媒体报道。 创始人赵越身上有许多有意思的故事:读医三年后退学重考、本科期间睡实验室、曾带领团队获得三届 Robocup 全球冠军、首次创业失败…… 大量成长过程中的趣事(尤其是在世界杯期间,我们聊机器人世界杯 RoboCup 聊了一个多小时),其实也与创业过程中的思考方式互文。 赵越带来一个有趣的暴论:未来所有公司都可以是机器人公司。也带来一些启示:越是纯粹的人,越有机会在专业领域获得成功。AI 时代,足够热爱的人将有更大机会获得成功。 强烈荐听这一期,希望你们喜欢:) (本期访谈的视频版已在 视频号、微博、b 站、小红书等平台登录,欢迎前往观看~) 本期嘉宾:赵越 (仙工智能创始人) 本期 Shownotes: Part 1.关于赵越:史莱姆、「卡拉米」和永远想「掀桌」的基因 01:23 仙工的吉祥物,是小怪物「史莱姆」 * 「开始都叫老板,新人一周内就会喊我越哥」 * 史莱姆(仙工吉祥物),最初级但也不容小觑的小怪物! * 从 wrong 到 right,要经历漫长的混沌 * 创业本质就是不停解决问题的过程 * 「加速开放多元的智能文明,让智能机器没有门槛」 06:26 湖南邵阳,浙大 8 年医学本科、退学,与夺冠少年 * 父母都是老师,「他们最大的贡献就是不管我」 * 浙大竺院的宽口径培养:8 年医学制,读到第五年,我退学了 * 白天紫金港,晚上玉泉——本科研究生几乎睡在实验室,不认识研究生室友 Part 2. 中国摘得 RoboCup 世界首冠:一个「小胖子」带队夺得三届冠军 15:15 从「小胖子」Picker ,到三届全球冠军 * 关于 RoboCup:2050 年击败人类世界杯冠军 * 还没有 Issac 和 Sim2Real 的年代:用 ODE 物理引擎 + CUDA 加速做仿真 * 8 毫秒决策周期、集中式控制场上 6-7 台机器人、GPU 算所有跑位与形势变化 * 2009 年开始接触强化学习,「逐条过对手的比赛日志」 * 代码里的 magic number(阈值数):引入随机性,是最有效的策略(今天的创业同理) * 「那个小胖子,你不要在场地上跑那么快!」 * 小卡拉米的蜕变规律:脱颖而出,往往不是因为优秀,而是因为热爱 30:14 中国首冠 & 一个「思想钢印」 * 初赛击败上一届冠军:整个场馆都震惊了 * 一个思想钢印的诞生:「你觉得是问题的、迟早有一天会找过来」 * 击败 CMU(卡耐基梅隆大学,机器人领域全球最强的实验室):把不可预测,转化为可预测 * 「太精彩了,不像机器人在对抗,像两个教练在对抗!」 * 与 Malona 在巴黎的会面(RoboCup 发起人之一,执行委员会主席):RoboCup 播下一片种子 * 热爱,无法伪装 Part 3. 未来,B 端不会有真正的机器人巨头出现:每一家公司都可以是机器人公司 53:21 机器人金字塔:能在底层解决的,不要往上层解决 * 机器人金字塔:机械 → 电子电路 → 底软 → 通讯 → 算法 → 模型 * 端到端 vs 分层架构的技术路线分歧:未来所有大脑模型,也会是 MoE 架构 * 自上而下 vs 自下而上的两派大脑 * 快速分裂 & 快速共识:2022 年大家讲 VLA、2024 年讲世界模型、2026 年讲无本体采集——共识每年重新洗一遍 * 具身分两维度看:**新技术范式 vs 新产品形态**——可以分别独立验证、没有必要绑在一起 * 数据如何低成本、可持续地涌现? 01:06:23 暴论:「所有公司都可以是机器人公司」 * 渐进式在 B 端赢、颠覆式在 C 端赢 * 「一吨货的三种解法」 * 工具是被人创造的——让人形去搬货,就像让自动驾驶去开油车,是退步 * 数据 ≈ 模型:一个拥有足够多好数据的公司,可以立于不败之地 * 好数据的三条件:① 真实场景采集的多样性 ② 天然对齐(不用花大量成本转格式) ③ 低成本可持续产出 * 仙工的独特资产:2000 种机型 × 400 种传感,接在自家传感器上,天然对齐;客户异常时主动把 corner case 给你 * 为什么不立刻训一个通用大脑,而是训垂类模型? * 产线没有巨头、机器人为什么一定要有标准的巨头? * 构建事实标准,与「反者道之动」 01:22:38 从方法论焦虑,到数据坚定 * 「现在这些 BP,没有 VLA 的我都不看了」 * 问题不是方法本身、而是数据 * 自动驾驶出身的,都会强调真机数据 * 新方法研究,是一个沿途下蛋的过程 * 挖角潮有感知,核心员工几乎没走 * 无为,是不妄为 01:53:16 第一段创业的失败:富士康点醒了我们 * 第一段创业「仙知」:沿着机器人四大家族一路模仿,发现似乎不对 * 富士康点醒我们:除了控制器,没什么是我们不能做的 * 与富士康的交易:交出图纸,买你系统 * 一台机器人上难以被统一的需求:当你把它升维到软件工具链层面,都能被统一 * 第一段创业的教训:现金流危急一年多 Part 4. 仙工的具身大脑路线:不立刻去训通用大脑,掌握数据会利于不败之地 02:10:00 机器人平台化战略的诞生:脏活累活,是护城河 * 控制器就是机器人的大脑(硬件承载 + 软件规则或模型) * 仙工如何成为机器人控制器全球第一? * 能不做的,都不做 * 海外市场与中国市场的差异 * 我们组建了一整套严选和评测体系 * 我们不做零件的原因:中国公司太厉害了,未来第一名不会有中国以外的公司 * 脏活苦活,才是一个科技公司真正的壁垒 02:36:19 谨慎做梦:可靠性、泛化性 & 后发优势 * 战略是长期的、不可撤销的投资 * 具身的实用主义:一端要可靠性(强化学习把场景打到极致),一端要泛化性——「两端兼具,至今我没看到信服的案例」 * 每次从 0 到 100,是为下一次从 0 到 1 换筹码 * 谈具身落地的真相:「大多数应该是不及预期的」 * 仙工的具身「四象限理论」:把「新旧技术」× 「新旧产品形态」拉出四个象限 新技术 × 旧产品形态(比如叉车具身化)——做落地引领者 旧技术 × 新产品形态(人形机器人的下层运控)——做具身行业的赋能者 新技术 × 新产品形态(比如具身大脑训自己的通用模型)——当下不做,全力积累数据 旧技术 × 旧产品形态——放弃 * 关于人形:不是没价值、是这套「基于数据训模型」的范式在人形上暂时难落地 Part 5. 道德经、鲁路修与稻盛和夫:「干掉第一」、「成为第一」、「不做第一」 * 《道德经》的「空」,与不妄为 * 「功成事遂,百姓皆谓我自然」 * 稻盛和夫和毛泽东:极致唯心 + 具体唯物的辩证 * 钢炼、鲁路修、高达、进击的巨人:神漫里有着美好的世界观 * 鲁鲁修震撼了我的世界观:主角让自己变成世界最大反派、被最好的朋友一刀刺死,用自己献祭了正义 * 消消乐哲学:做到第一就要清空重来,否则容易变成那条恶龙 加入听友群⬇️:

224分钟
14k+
6天前
78.Seedance之后,视频Agent何去何从?|与 OiiOii 闹闹聊视频模型的秘密:数据、生态与感性的结构化

78.Seedance之后,视频Agent何去何从?|与 OiiOii 闹闹聊视频模型的秘密:数据、生态与感性的结构化

卫诗婕|商业漫谈Jane's talk

Sora 之后,Seedance、可灵等国产视频模型,做出了世界的高度——中国视频模型为何能领先全球?Seedance 的发布(最新已经是 Seedance 2.5 的发布啦),究竟是结束了视频 Agent 的战争,还是开启了它? 我和 OiiOii 创始人闹闹,一起还原了属于视频战场上的大模型及智能体之战。 (本期内容详细梳理了 Sora 之后,视频模型的发展,及视频模型训练背后的人才体系、训练方法、数据奥秘,非常值得一听,也欢迎前往各大平台-B 站-小红书-视频号等,搜索本期内容的视频版😁) 从腾讯微信、字节剪映到创立 OiiOii,闹闹特别分享了她的产品世界观——感性与理性,是一体两面。而在视频这个领域,感性如何被量化,既是科学,也是艺术。 本期嘉宾:闹闹(视频 Agent OiiOii 创始人,前字节剪映负责人) 本期 Shownotes: 02:01 Part 1. 闹闹的成长史:观察者、群体之外与"创造环境" * 当一件事需要你自己去创造一个环境 * 腾讯和字节是产品观的左右脑 * 张小龙的 8 小时内部产品演讲,"他用人类外的视角在观察人类——把人性的善和弱点放在放大器里发酵,再像园丁一样修剪” · 在字节学到数据的应用,也看到数据的滥用——明知一个实验数据怎么才能为正,就为了正而去做它,但这不代表它长期是正的 * 内容型产品的核心,是把感性的好与不好归类量化 18:27 Part 2. 视频模型路径的判断:从 Sora 2,到 Seedance * 早期视频模型以首尾帧为主——Vidu 第一次把“多参考图"这个概念做出来 * Sora 2 验证了多参方向,开拓了模型的想象力 * “Seedance 基本是 Sora 2 的升级版” * 什么是视频生成的最佳实践? * “描述词要加正向和负向词,要叠加约束” * “视频生成交互的下一步不一定是文字” 27:28 Part 3. 为什么最好的视频模型出现在字节快手这样的短视频平台? * “视频模型不是创业公司该做的” * 大公司的数据护城河:有过去做图形图像算法的积累,可以制定标注标准,执行到八九十分 * 可灵的前世今生:2021 年,快手 Y-tech 算法团队在视频理解上就不弱于(甚至强于)字节 AI Lab * 两条视频模型路径:通用大底座(Seedance) vs 专业领域优先(可灵) * 生态是分水岭:同样的算法,能不能用好这些数据,取决于过去推荐系统里有没有相关应用经验 * 中国为什么能在视频模型方面领先? * OpenAI Sora 的失败不是技术失败,是生态失败 * 视频模型领域的护城河不是算法,是"数据标注标准 + 组织执行力" 34:15 Part 4. 模型不会被吃掉 Agent 的部分是?harness & 感性 benchmark * 视频模型目前的不可能三角:效果、生成时间、生成成本 * 模型会往哪些确定性的方向迭代? * 多模和语言模型有哪些本质不同?——感性可以被结构化但颗粒度更粗 * Harness 一定会进入多模和视频领域 42:33 Part 5. AI 时代的「剪映」(or not ):第二次创业为什么是 OiiOii ? * AI native 的产品需要新形态 * 关于创作者的物质激励 & 精神激励 * 动画是 Agent 适合进入的绝佳行业 * 模拟剧组:OiiOii 的 7 个角色、改变生产组织、抽卡降本 * 内测码 10 万人排队的原因 * Seedance 给我的冲击有哪些 * MidJourney 没被吃掉的原因 * OiiOii 的产品团队,由谁构成 57:02 Part 6. Sora 关停与 Seedance 2.0:视频 agent 战场是终结了,还是开启了? * Sora 关停——它做错了什么? * Seedance 2.0 是升级版的 Sora,它的弱点是什么? * 海量视频 agent 涌现是"妄想"?——哪些套壳在骗钱? * 怎样的产品是“纯套壳”?鉴别 Agent 的厚度… * 视频领域不会 winners take all … * 为什么抖音特效的参考意义极大… * ACG (动画、短漫剧、游戏)的 Agent 机会:生产关系的改变才是更值得思考的价值空间 * 我与字节:「你要相信字节是一家非常精明的公司…」 * 如何侦查模型厂商动向? 01:32:18 Part 6.「这个时代最缺的就是谦逊」 * 模型涨价了怎么办? * 国内 agent 调度的视频模型有? * Seedance 最值得学的是什么? * AI 时代顶级产品经理画像长什么样? * AI 时代的自信与盲目 如果喜欢「漫谈」,欢迎加入我的听友群~⬇️

105分钟
12k+
2周前
77.有关智元、觅蜂的愿景与野心,和具身智能的竞速之旅|与姚卯青的对谈

77.有关智元、觅蜂的愿景与野心,和具身智能的竞速之旅|与姚卯青的对谈

卫诗婕|商业漫谈Jane's talk

2026 年,具身智能成为了聪明人扎堆、资本热潮近乎疯狂的行业。这条热门赛道中,智元机器人是最早的百亿俱乐部成员之一。 在人形机器人出货量狂奔的路上,智元的野心并不止于“具身本体”的军备竞赛。今年,他们做出了一个让全行业瞩目的反哺举措:将旗下的核心数据资产彻底剥离,独立孵化了全球领先的一站式物理 AI 数据服务平台——“觅蜂”。 本期嘉宾姚卯青,不仅是智元合伙人、具身业务部总裁,也兼任觅蜂的董事长兼CEO。这期播客在五月觅蜂发布会后录制,或许是有关智元战略的,最深入完整的一次访谈。 (本期视频的微博开屏页,欢迎前往微博等平台观看视频版~;也欢迎前往公众号,查看「漫谈Light the Star」访谈的文字版~) 从Waymo到蔚来再到智元,姚院亲历过自动驾驶从概念到量产的全过程,他说“今天的具身智能连GPT1都没到”,而机器人离真正涌现智能,还差一亿小时的数据。 本期嘉宾: 姚卯青(智元合伙人、通用业务部总裁, 觅蜂董事长兼 CEO) 本期 Shownotes: Part 1. 02:40 关于姚卯青:从清华电子系到南加大,从 Waymo到蔚来 * 「人间清醒」与「顺势而为」 * 清华电子系的系统训练:电路、通信、信号处理、计算机视觉、编程和算法,都是自动驾驶和具身智能的底层能力 * Google Display Ads 团队:计算机视觉、NLP 与 Transformer * 内部转岗 Waymo:可能是当时全球最难的面试 * Waymo 的三年: Robotaxi, 从技术 demo 走向商业化运营 Part 2. 17:28 蔚来的量产课:激光雷达、车规体系和数据飞轮 * 为什么选择蔚来? 「单平台、全标配」的产品策略,激光雷达、4K 相机和高算力硬件一体的统一底座 * 蔚来李斌:「被人骂也是被记住的一种方式」——做关键决策需要勇气 * 多模态融合感知、激光雷达感知、BEV、Occupancy Network、AEB …关于自动驾驶的种种 * 选择回国:相比 Waymo 的几百辆 Robotaxi,国内乘用车百万级保有量所带来的数据分布和 corner case 密度,是完全不同的飞轮 * 量产经验到底是什么?「不是把样机多复制几台,而是项目、研发、测试、供应链、质量、版本和数据闭环的组织能力。」 * 能迁移到机器人的是什么?异常数据回流、模型迭代和现场版本下发 Part 3. 28:31 当自动驾驶派进入具身:优势不是算法,而是底座 * 自动驾驶派进入具身智能,最大的价值是理解强电系统、供应链、质量、量产和底层软件稳定性 * 机器人和车,在电子电气架构、操作系统、中间件、传感器输入到电机控制等底层工程上高度相通。 * 车就是最简单的机器人?「有点牵强」 * 在很多低速场景中,机器人反而更有机会部署 VLA、世界模型等前沿模型 * 真正稀缺的人才,不只是刷榜或发 paper 的人,而是上手修过 bug、和硬件软件都打过仗、能把复杂系统跑稳定的人 * 具身创业的三大派,都有不可替代性 * 机器人终局架构不会只是「快慢系统」两层,可能包含: 1000Hz 底层控制、10 到 20Hz 动作规划、1 到 2Hz 阶段目标规划,以及更高层的 Agent 长程推理。 Part 4. 35:19 讲「基模」太早了,具身连 GPT 1 都没到呢! * 「2026 年了,具身智能到底到 GPT 几了?其实 1 都没到呢」 * 「现阶段的真机数据量,和真正支撑基座模型涌现的数据规模,还差四五个数量级」 * 很多公司强调自己做「具身基模」,是借用了大语言模型时代的资本叙事 * 今天的具身更像 Transformer 和 BERT 早期,而不是 GPT-3 之后 * 数据的关键不仅是「量」,还包括信息维度、场景种类、失败样本和真实部署中的边界样本 * 多模态融合是必然趋势,视觉远远不够 * 真正的瓶颈不是算法是否足够聪明,而是真实世界数据的量、模态、场景和失败样本远远不够 Part 5. 49:59 有关智元最完整的战略揭秘:一家 AI 公司,而不只是机器人公司 * 神秘的邓泰华其人 * 智元Day 1 定位成 AI 公司,而非单纯的人形机器人公司 * 人形机器人是把 AI 带入物理世界的必要载体,但不是终点 * 「智元确实是这个行业里最有野心的公司之一」 * 智元的组织架构、融资节奏与股权激励 * 具身公司的长期价值不只在本体硬件,而在能否把「本体、数据、模型、场景」做成闭环。 * 精灵 G2 所经历的完整 IPD 流程:接近 9 个月 * 机器人行业的需求峰谷比汽车更剧烈 * 工业不相信眼泪,最终都是 ROI:「」工业客户不关心你是人形、猴形还是狗形」 * 智元的「358 战略」:从量产、商用到部署 * 具身智能最终不是单点技术竞赛,而是系统工程。 * 当技术路线逐步收敛、场景开始渗透时,先把 90% 的体系能力构建好,才可能真正承接行业机会。 Part 6. 01:55:26 VLA、世界模型和机器人数据飞轮 * 智元的 AI 研发体系:模仿学习、VLA 预训练、世界模型、强化学习后训练和数据闭环 * Google PaLM-E :VLA 来自语言模型和多模态语言模型向物理世界的迁移 * 世界模型更像对物理规律和状态转移的数字化、神经网络化描述 * 「VLA 和世界模型都不是最终形态,未来更可能是分层架构」:前̶者̶受̶限̶于̶语̶言̶和̶动̶作̶之̶间̶的̶表̶征̶鸿̶沟̶,̶后̶者̶仍̶更̶多̶来̶自̶二̶维̶视̶频̶和̶第̶三̶人̶称̶视̶角̶ * :̶语̶言̶推̶理̶、̶物̶理̶预̶测̶、̶低̶层̶控̶制̶、̶长̶程̶规̶划̶和̶数̶据̶飞̶轮̶共̶同̶工̶作̶ * 世界模型的价值在于学习液体流动、玻璃破碎、软体形变等真实物理规律 * 「后训练和失败数据非常关键」 Part 7. 02:08:49 觅蜂:具身版 Scale AI,机器人数据界的「滴滴」 * 投资人的主意:对标上一轮 AI 时代的 Scale AI ? * 具身数据生意比传统数字世界标注难得多 * 2026 :具身数据军备竞赛年 * 模型的差异化暂时不大,数据会是分水岭 * 打造一个公共性质的数据服务平台,一个「阳谋」:客户花钱带来数据需求,平台用数据训练模型,模型再反哺采集、预标注和质量管理效率 * 数据问题都没解决,讲基模预训练、后训练,都是空中楼阁 * 高质量数据的第一点是真实:场景和任务必须足够丰富,能够覆盖生活和生产中真正会遇到的问题 * 规范:相机曝光、画质、设备同步、轨迹重建精度、操作流程都要高标准 * 「脏数据」不是质量差的数据,而是包含失败、偏移、纠错、重新规划和最终成功的多样化数据 * 仿真数据并不天然低价值 * 关键不是流派,而是任务、场景、成功率要求和模型使用方式 * 数据的价格、产能和全球化 * Deepmind 和 Genralist:「如果数据是具身智能竞争的唯一决定变量,中国公司现在就可以宣布他们是赢家」 * As many as possible, as soon as possible(越多越好,越快越好). Part 8. 02:43:43 从数据标准,到 G3-G4 中间态 * 好的数据标准会逐步收敛 * 即使不同机器人硬件不统一,很多数据仍可以被抽象为通用表达,如末端执行器轨迹、二维帧序列、物理状态变化等 * 机器人行业的安全和质量准入标准,会在两到三年内伴随大规模商用逐步出现。 * 从 G1 到 G5 ,当前行业大约处在 G3 到 G4 的中间态 * 预计 2027 到 2028 年行业有希望达到 1 亿小时级数据规模 * 真正类似语言模型那种涌现能力,还需到 1 亿小时级高质量数据出现 Part 9. 02:54:42 最期待的画面:机器人第一次让人觉得「觉醒了」 * 机器人出现真正的 aha moment:不再只是从画面到动作的肌肉映射,而是能在复杂环境里自主规划、理解指令、做出响应 * 涌现时刻大概率发生在实验室,而不是工厂 * 数据会成为这一轮智能化转型关键基础设施,但它比算力更难获取 加入听友群⬇️

178分钟
23k+
3周前
76.与 00 后创业者源培的访谈:从 RoboMaster 到李飞飞实验室、两次「全球首次」,与自由快乐的非标人生

76.与 00 后创业者源培的访谈:从 RoboMaster 到李飞飞实验室、两次「全球首次」,与自由快乐的非标人生

卫诗婕|商业漫谈Jane's talk

AI 原生一代,将写下怎样的新故事。这是这一轮 AI 浪潮以来,投资人们最关心的问题。 今天的访谈嘉宾,是 00 后具身创业者,陈源培。 他曾在斯坦福李飞飞的实验室,实现了全球首次双臂长程灵巧操作,以及全球首次「用人类数据训练机器人双臂灵巧操作」。 土木工程本科出身的他,高考前一天还在打游戏,却通过 Robomaster的比赛结缘机器人,并跨界师从北大强化学习专家杨耀东,成为强化学习的前沿学者,继而进入斯坦福李飞飞的实验室,做出全球首创的成果。 相比「天才少年」叙事,这期更值得品味的,是一个一再印证,学习没有固定范式、创新没有标准答案的故事。以及开放、多元、包容和谦卑的学术品味与视野。 无论游戏、RoboMaster、科研,在源培那里都有一条共同线索:它们都像升级打怪,靠快速学习、持续探索和反馈提升能力。希望其中的思考方式,能给大家启发。 (本期视频欢迎前往 b 站、视频号、小红书、Youtube 等平台观看~) 本期嘉宾:陈源培,灵初智能联合创始人 本期 Shownotes: 02:51 从游戏到 RoboMaster:工程能力从系统里长出来 * 高考前还在打牌的 00 后:通宵打游戏,差点被选去电竞青训 * 父母最大的影响是「完全不管我」 * 大疆 RoboMaster 冠军:机械、电控、嵌入式、上位机、控制、算法…训练的是复合能力 * 深入代码底层,不会并不是一个门槛 * 机器人并不是单点算法问题,全栈系统思维是稀缺的 * 工程性的东西,更多看的是细心程度与快速学习能力 * 俄乌战争给源培的「觉醒」——突然觉得发 paper 、抠创新点,对世界没什么帮助 16:41 师从杨耀东,最早 Isaac 使用者与并行仿真 * 师从强化学习知名学者杨耀东,用强化学习做灵巧手 * 零帧起手强化学习 * OpenAI 的 Shadow Hand (2019)的解散,强化学习解魔方——酷但昂贵 * 「我是英伟达 Issac 最早的使用者」「那个版本应该绝版了」 * 「未来用 GPU 做仿真,一定是大势所趋」 * 首篇论文即震撼行业:高自由度操作可以在大规模并行仿真中训练出来 35:05 强化学习 vs 模仿学习,什么是训练直觉? * 强化学习的峰回路转:监督学习和模仿学习的短期效果让强化学习一度被质疑;直到O1 等方向又重新证明了强化学习的价值 * 模仿学习见效快,但泛化弱;强化学习潜力大,但极吃 Know-how * 模仿学习不是未来 * 从人手中心到物体中心:描述物体轨迹如何变化,让机器人知道大致目标,再在小范围里探索 * 奖励不需要把每个动作写死,需要留有空间任 AI 自己探索 * 真正的系统能力是「方法都告诉你了,但你调不出同样效果」 * 我训强化学习还挺厉害的:「基本上大家以前都看曲线,只有我是打开仿真,盯着机器人学习。」 43:37 进入斯坦福李飞飞实验室:从强化学习中心主义,到多元的学术视野,与技术地图 * 每条路线都有价值,未来更可能是吸收各自优点的融合过程 * 更开放的研究氛围:连接图形学、灵巧手、模仿学习、人类数据 * 师从 Karen Liu :把机器人操作、动捕、人类数据和仿真强化学习连接起来 * 不要太 Ego,不要靠形容词证明强,让结果本身说话 * 一周可以水一篇顶会的代价是放弃自己其他可能性 * 「从斯坦福回来后,他像变了个人一样」 50:51 跳出舒适区 + 螺旋上升的具身技术史 * 具身技术发展的螺旋:抓取→ CV+模板 → 直接学轨迹(模仿)→ 人遥操太慢 → 强化学习自己探索 → 仿真效率低→ Isaac Gym 并行仿真+Sim-to-Real → Sim2Real Gap 太大→ 软体场景模仿学习反超(Diffusion Policy/ACT)→模仿学习也不够→ 后面接强化学习→世界模型起来后,又回到仿真训 RL * 灵巧手最大的价值,不是因为它像人,而是因为它最容易吃下人类操作数据 * 与夹爪或专用末端执行器相比,五指手和人手之间的 Embodiment Gap 更小,更适合做 Human-Centric 数据采集 * 「以物体为中心」的通用表征:操作的本质是让物体沿某条轨迹发生变化,而不是复刻人的每个关节动作 * 具身 Scaling Law 的核心可能不在遥操数据,而在人类日常操作数据; * 硬件形态本身会决定能吃下什么样的数据 * Sequential Dexterity 的祛魅:学术需要 novelty,这没太大意义 58:26 仿真派的价值和上限 * 我曾经就是个仿真派 * 仿真无法根本解决真实世界复杂交互,尤其在软体、碰撞、接触和高精度成功率方面 * 可微仿真和世界模型都试图缩小 Sim2Real Gap,但目前仍受限于算力、图形学、物理交互和数据量 * 仿真 vs 真机,谁快?仿真的场景 Scaling 能力未必比真实世界快 * 仿真可以做出很 Fancy 的 Demo,但不是当前可见的终局 * 如果世界模型足够强到生成全场景仿真,它本身也需要先吃下海量真实数据——如果做出了世界模型,那肯定先做出了好用的 VLA * 一个研究者最重要的能力不是在舒适区里把"已经会的事"做得更深,而是逼自己跳到不熟悉的方向;这一点反人性反惰性,因为你在擅长的方向也确实有想探索的东西 01:17:02 具身 Scaling Law 会撞上硬件问题 * 具身 Scaling Law 的核心问题是数据,单靠遥操数据很难堆到足够规模 * 百万小时级别的人类中心数据,至少能让行业看到一些效果 * 「我是实用主义派」 * 与语言模型不同,具身智能会遇到硬件差异:不同手、不同本体、不同自由度都会影响数据和模型泛化 * 跨本体泛化的关键,是提取人类操作中通用的信息,再用强化学习补足机器人具体关节、力和接触细节 * 语言模型可以在统一的 token 空间里 Scaling,具身智能必须同时解决数据规模和硬件本体差异 01:22:12 创业后的路线选择:先坚定,再快速调整 * 2024 创立灵初时,市场上很少有人强调灵巧手操作和强化学习 * 择做长程灵巧操作、强化学习、人类中心数据和双手路线,对于一家创业公司,是信仰和耐心的考验 * 要去做别人做不到的事 * 当前的路线没有不能复刻的,都不够本质:但仍然保持灵活,可快速调整 * 具身创业的难点是同时平衡商业化和预研,短期场景可以做,但公司不能忘记自己到底是不是模型公司 * 「你不能有包袱,最后还是结果说话。」 01:38:04 世界模型、VLA 和算法口号的泡沫 * 灵初的具身大脑是糅合路线:硬件、采集、数据处理、模型训练和部署,形成端到端闭环 * 模型架构和口号本身不是护城河 * 广义 VLA 只要输入视觉和语言、输出动作即可 * World Action Model 也只是增加未来帧预测等辅助监督 * 单靠改模型架构、模块连接方式就带来突破性变化,我认为这几乎是不可能的 * 真正重要的是训练范式、数据规模、数据质量和完整 Infra * 马斯克为什么不喊世界模型——世界模型本身不产生价值,真正产生价值的是它能否在具身、能源、航天或其他真实任务中解决问题 * 具身行业的泡沫:太多人说的和做的不一样,一些投资看不太懂 01:45:05 主动世界模型:从数据里选择有用信息 * 关于「主动世界模型」的思考:机器人需要主动判断哪些信息有用,哪些是噪声 * 世界感知分成客观世界规律、主动选择机制和自身 Policy 三层,其中最缺的是中间那层主动选择 * 数据 Scaling 不是无脑加数据,低信噪比数据可能损害模型能力 * 我是实用主义:脑科学、神经元结构、主动世界模型等想法都可以借鉴,但必须通过效果验证 * 具身下一阶段的底层创新:可能不是继续堆模块,而是找到类似语言模型 next-token prediction 的训练范式 02:03:15 「我的人生,绝对不可能不快乐!」——兴趣、非标与系统性思维 * 不要害怕环境、专业或起点带来的限制,去做自己真正感兴趣的事 * 机器人人才,最重要的三点:追求卓越、系统性思维、不要太 Ego * 「再垃圾的 paper,也有你可以学习的点!」 * 「我追求的是影响力,对真实世界产生价值的影响力」 * 未被验证的人才和未被验证的路线,可能写下真正的突破 加入听友群⬇️:

134分钟
12k+
1个月前
评价

空空如也

加入我们的 Discord

与播客爱好者一起交流

立即加入

扫描微信二维码

添加微信好友,获取更多播客资讯

微信二维码

播放列表

自动播放下一个

播放列表还是空的

去找些喜欢的节目添加进来吧