卫诗婕|商业漫谈Jane's talk - 节目列表

83.宇树上市:王兴兴的「幸运」,投资人的「教训」|对谈宇树早期投资人、初心资本田江川

83.宇树上市:王兴兴的「幸运」,投资人的「教训」|对谈宇树早期投资人、初心资本田江川

卫诗婕|商业漫谈Jane's talk

宇树科技正式敲钟上市了。 我曾在第 65 期节目(《除夕夜,与王兴兴的对谈》),于除夕夜春晚舞台演出之后,专访过宇树的创始人王兴兴。 那次对话的震撼一直持续至今。在我的认知里,宇树绝对不只是又一家把硬件卖到全球的成功企业。 它是一个真正能开启中国硬科技全新创新时代的范本。 宇树证明了:中国创业者能够用极致的工程创新、并将中国硬件的优势发挥到极致,从而做到引领全球;他们不需要光鲜的履历,就能让全球最顶尖的实验室基于中国团队的硬件去定义行业标准。 我们试图回到那个没有聚光灯、甚至充满偏见的起点。 我邀请了宇树的早期投资人、初心资本的管理创始人田江川,一起复盘了宇树这个项目所有的非共识。 如标题所说,早年融资上捉襟见肘,反而成了宇树最大的「幸运」;当年被顶级 VC 视作“短板”的草根背景、手搓 BP、不做视觉算法的王兴兴与宇树,最终却构筑了断代级的壁垒。 某种程度上,宇树和王兴兴实现了一次中国投资人们的集体认知升级——有关反精英主义的傲慢,与什么是真正的创新。 本期嘉宾:田江川(初心资本管理合伙人 、宇树早期投资人) 本期 Shownotes: 02:25 2015 & 2025 :投资的 vintage year * 乔布斯的「初学者心」:持续对世界保持热爱和好奇 * 2017 年,3000 万人民币估值的宇树 * 王兴兴 2019 年的 BP * 投资行业正不断回馈胆子大的人 * 2025 年技术变革中,话语权只掌握在少数人手里 00:07:22 2017,为何在Costa咖啡馆里错过了王兴兴? * 「让机器人走进千家万户」的 passion 打动了我 * 电机这个路径一定是更好 scale 的,但当时我没有意识到 * 宇树是Macintosh 级别的创新 * 人才策略的三星模型—— poor 、smile and desire * target mass market * 哪个年份的阿里人含金量最高? * “两真两网”体系:真问题、真专家、认知网络和信任协同网络 00:19:31 宇树不是一家机器人企业,它是一家全球性的生态平台 * 宇树的高毛利和量产能力从哪来? * 宇树如何站住了生态位?它的壁垒是什么? * 宇树的「幸运」:兴兴的英语是很不好的,但是day1 他就选择做海外 * 宇树其实是一家生态平台 * 「他们还会进入科研市场吗?其实很多是不会的了。」 * 「这么多岗位是谁在做?他当时说:是我。」 00:30:05 孤独的创新者:厚积薄发的六年 * 在一个无人区创新,即便不好走,但没有那么多竞争 * 宇树和大疆相似的成长路径 * 王兴兴给市场的强压迫感:一般都会早于市场 3-6 个月,推出一款别人赶不上的产品 * 2025 年春晚,中国具身行业的分水岭 00:53:55 人才审美:极客、科技理想主义者,与清醒的野心 * 所有 10 倍的优势,都是非常了不起的信号 * “A user is a player.” * 点亮宇宙科技之树 * RoboMaster,是培育大疆竞争对手最大的温床 * 「三非」:扶持非共识、非中庸、非主流创业者 01:15:57 具身智能布局:这个时代的船票只属于少数人 * 中国具身的红利 * ToC 端未形成 PMF 的核心原因:核心技术不到位,目前仅能提供情绪价值 * 具身领域存在类似 SaaS 的确定性机会 * 硬件赛道更离散,行业有巨大增量 * 地缘政治的最大挑战 01:36:59 MIT 的冲击与 VC 行业的残酷法则 * 管理是一门科学而非艺术 * 「裸奔做一个 CEO」 * 理解了文化差异,就能理解中美为什么会脱钩 * 天赋与勤奋:「今天你因为要出去滑雪,你就错过了字节」 * 创新的根本,就是顶级人才的流动 加入听友群⬇️:

115分钟
25k+
3天前
82.具身是一场马拉松,VLA 和世界模型都不够本质|一个华为天才少年的具身启航

82.具身是一场马拉松,VLA 和世界模型都不够本质|一个华为天才少年的具身启航

卫诗婕|商业漫谈Jane's talk

这是一个在 2026 年才正式浮出水面的具身明星项目。 墨奇智能成立于 2025 年底,半年内完成超过 10 亿元天使轮融资。创始人黄青虬是前「华为天才少年」,亲历华为智能驾驶从 0 到 1 、从第一代到第四代的完整建设,离职前,他领导 200 余人团队,时任AI 模型开发部部长,并把端到端方案推向量产。 从去年年底开始,这个项目是具身领域投资人们纷纷约见和抢注的对象。 从本科、博士到华为工作,黄青虬完整经历了机器人的小脑、大脑及系统的学习、探索和实践。其中穿插着清华火神队、汤晓鸥成立的 MMLab 以及华为自动驾驶,这些人工智能的传奇之地。 这是一期信息量很高的访谈。它能解答一个问题:为什么在 2026 年,具身浪潮已经狂飙了三年、全行业有数百家具身企业之后,这个赛道仍然有新选手的机会。 要点概览: • 具身是马拉松,不需要弯道超车。 • 具身量产需要更严格的定义。今年能产出 5000 台靠谱机器人的公司,不会超过三家。 • 数据的质量,远远重要于数量——在一个人人都高喊「1000 万小时」「1 亿小时」数据的时刻,黄青虬认为,今天行业接触到的具身数据「质量是不够高的」,且缺乏统一的标准。 • VLA 和世界模型是一体两面,但它们都「不本质」。 视频版将在 8.4 日中午上线各大平台:b 站、微博、小红书、视频号等,欢迎前往:) 本期嘉宾: 黄青虬 ( 墨奇智能联合创始人兼 CTO , ex 华为天才少年) 本期 Shownotes: 05:36 最晚下场的「华为天才少年」,与具身爆发的节点:2026 才出发,晚了吗? * 大模型从 chatbot 发展为 coding 、agent 成熟 * 智驾领域实现可泛化、可大规模商用的端到端一段式控制技术 * 批量具身公司出现,具身创业门槛不高? * 「投资人可能默认我能做成」 11:34 具身是一场马拉松,不是百米冲刺:起点差几个身位,没有太大的区别 * 技术范式未收敛,所以起点不重要 * 行业热度高,人才分散浮躁——这个领域需要怎样的人才画像? * 太多人谈弯道超车,什么是这个行业真正的基本功?硬件可靠性、算法数据模块的精度效率是「苦活累活」 19:20 路线选择:toC 一定是终点,但可以先把 toB 当跳板 * 场景选择:可泛化、可分阶段落地、能够回流高价值数据以迭代通用模型 * 具身行业的数据质量很成问题 * 好数据的三个条件 * 「具身的 Scaling Law 会比大语言模型更难 」 * 具身模型存在模型结构的矛盾,挑战很大 29:28 算法不重要?「算法是这一轮智能的核心」 * 算法架构是容易抄的,但探索过程中积累的方法、人才、组织氛围无法复刻 * 成立仅半年,月算力投入达千万级,算力投入可排行业前五 * 「这个行业的算力投入与行业热度,是不匹配的」 * 大脑的算力门槛为千卡级别,要出突破性成则果需达万卡级别 36:58 机器人兴趣:从《铁甲小宝》、《黑客帝国》,到清华火神队 * 赵明国老师的清华 508 实验室 * 「不要随大流,要有自己相信的研究方向」 * 运控古典派如何看待宇树:Sim-to-Real 最小背后,硬件一致性与参数整定 * 细节决定成败:负载系统会放大误差难以溯源 53:24 从机器人「小脑」到「大脑」:传奇 MMLab 带来的一切 * 初识 CV:恰逢 ImageNet 诞生,多模态理解一定是大势 * 商汤往事:在文津国际公寓的岁月 * 汤晓鸥强调的「黑羊文化」 * 从封闭式走向开放式的命题:重新定义系统 * 什么是具身大脑的核心? * 通用的「特征提取」 * 什么是好的系统? 01:17:11 加入华为:「华为天才少年」、救火、与自动驾驶的四代更迭 * 「华为天才少年」打破了外界对华为的刻板印象 * 「银狐」量产救火:从没上手过激光雷达,却完成了算法修复,怎么做到的? * 什么是可迁移的经验?如何迁移? * 从六七人扩张到200人的管理与文化:同理心是关键,找寻一致的人 * 什么是真正的财富?地狱级的量产有更严苛的标准,刷榜没有意义 01:36:03 「VLA 和世界模型,都不够本质」 * 为什么会出现各类技术方向:具身模型动作模态稀疏、反馈少、训练慢 * VLA 和世界模型是一体两面:都是为了将模态从稀疏推向稠密 * AI 仍是一门实验科学,需要大量验证试错 * 华为自动驾驶 4.0 量产完成,我从华为「毕业」了 * 如何做技术选择?「美的东西,都是简洁的(Simple but work)」 02:00:07 量产的定义需要更严格:不能做到 7✖️24 小时运转,每一台机器人保持一致,就是原型机! * 中国做硬件、硅谷出软件(大脑)的故事几乎不会重演:具身的数据是要从头来过的 * 「ChatGPT 的 changing point ,只是刚好出现在 OpenAI」 * 每次推倒重来,才有机会提升智能的上限 * 「我对量产的定义可能更严格」「我希望做一家靠谱的公司」 * 「今年能产 5000 台靠谱机器的公司,不会超过三家」 02:09:32 豪华团队:追求「温柔与坚定」,有趣也很重要! * 具身很复杂,「你永远不知道会出什么幺蛾子,需要非常健康的心态去看待这些状况」 * 工程很重要,学术 taste 也很重要 * 做机器人很苦:产品和团队的调性会影响心情,心情又会影响灵感 * 乐观是一种可被习得和塑造的方法 * 「看一看表,还有二十几年——是时候开始做了」 加入听友群⬇️

146分钟
19k+
2周前
81.Agent Infra,巨头都在布局的隐秘赛道|与百度王雁鹏聊模型、智能体与 AI 基建的新动向

81.Agent Infra,巨头都在布局的隐秘赛道|与百度王雁鹏聊模型、智能体与 AI 基建的新动向

卫诗婕|商业漫谈Jane's talk

我们正经历从模型时代到 Agent 时代的过渡。 底层技术正在发生怎样的演变,有哪些硅谷与国内的重要 AI 趋势?为什么这是工程师最好的时代? 这期播客,我邀请了百度智能云AI 计算首席科学家王雁鹏,深入探讨 Agent Infra 这个重要的「隐秘战场」。 (本期视频版也已上线:欢迎前往 b 站、视频号、小红书等平台观看~) 本期嘉宾:王雁鹏(百度智能云 AI 计算 首席科学家) 本期 Shownotes: 01:46 模型动向、AI 基建正在发生什么? * 什么是 AI Infra?「Infra 其实就是抽象一个层次,这个层次有足够的通用性。」 * AI Infra 为什么从软件走向软硬一体?「前一代的 Infra 基本上全是软件视角,这一代 AI Infra 有一个巨大的区别:它是以 GPU 为核心构建的。」 * GPU 极大释放了算力,但是牺牲了通用性 * 从 AI Infra 到 Agent Infra ,意味着什么?「完成真实任务意味着我得有一个完整的环境,人操作的所有基础设施和软件,都要被 agent、被 AI 去用。」 04:25 Agent 从 demo 走向生产环境,还差什么? * Agent 的三阶段 —— 从 Chat 到「完成岗位」的鸿沟 * 模型能力边界,决定 Infra 抽象层在哪里 * 新时代的数据库是什么,memory 系统长什么样,还在变化 * 模型的智力等于算力,算力等于电力 * Agent 可控、可信任:每一次执行结果不变、可重复 * 基础设施层面,需要构建一套能够快速部署、快速开发、大规模运行的系统,一个更强的推理集群 12:03 OpenClaw、Hermes 与 Agent harness 的范式变化 * 「Claude 4.5 出来时,程序员圈已经被震撼过一波」 * 「Openclaw 第一眼没什么特别,再看还是有点东西」 * harness 的三件套:loop(主循环) + tools(调用工具) + memory(记忆系统) * loop 的通用性极强 :「让大模型看上一步结果 → 分析问题 → 决定下一步 → check 是否达标」 * Memory 从 RAG 演进到文件系统:更通用 * Hermes 的更进一步 —— 自动净化 skills(定期反思:这个任务哪里不好、下次怎么做更好、整理成明天可用的 skill) 18:44 模型即 OS :大家争夺的都是超级入口 * 为什么 agent 会越来越多:大模型以后会是 OS,是大脑 * 通用大脑就像天才:可以做任何事,但不会 day1 就能做任何事,中间的学习成本 + knowhow 沉淀 = 应用层的价值 * Agent 的三大支柱:长上下文冲击算力、存储、网络与 CPU 消耗 * CPU 的消耗,可以窥见 Agent 诞生了多少真实价值 * 「这仍然是巨头的游戏」 * 为什么英伟达的生态很难撼动? 36:42 Agent Infra,巨头都在布局的最吸金、最隐秘的赛道 * 智能 = 算力 = 生产资料 * 「所有巨头都会往下做垂直整合」 * Anthropic、OpenAI、Google 的 Infra 路线差异: 谷歌,最典型的垂直整合派:TPU 做了近 10 年、JAX 自研、Infra 自研、模型自研 —— 芯 、 云 、 模真正一体化 Nvidia:不再是芯片公司,而是系统公司 Anthropic(轻资产,聚焦入口派):聚焦模型 + Claude Code 这个高价值入口;算力靠跟 AWS / Google 签协议保障,短期不用自己造芯片 * OpenAI(重资产,生态平台派):「从 GPT Store 那时就想做 App Store 式生态」; * 垂直整合的隐藏难点:「软件世界与硬件世界有 gap」 * 「今天定义的芯片两年半后出来时,还是不是那个模型需求?很大程度上不是」 * NV 的缝隙在推理系统 51:19中国 Infra 路径:多芯适配、开源生态 * 国内 vs 国外 Infra 的两大差异: 芯片环境不一样:国外主要在 NV 生态;国内要考虑国产芯片、要做更多多芯适配 中国的开源远远领先于美国 —— 开源意味着**模型架构透明**,做芯片的能知道往哪里走 * 百度智能云的两个押注:更高的算力与 Token 效率 + 和未来的新星走在一起 * Robin(李彦宏)提出的新指标 DAA(Daily Active Agents) —— 替代 Token 数量作为 Infra 层的牵引指标 * 「Token 数是一个会被玩坏的指标」:不能做杀鸡取卵的事 * 提升 DAA 的路径:**让开发更快** + 让运行更稳(可自动恢复、结果可 check) + 分任务价值高低(高价值多花功夫做) * 趋势:从 Token 到 DAA :Agent 时代需要更多衡量真实价值 * 提升 DAA 的路径:让开发更快 + 让运行更稳(可自动恢复、结果可 check) + 分任务价值高低(高价值多花功夫做) 01:00:22 为什么这是工程师更好的时代 ? * 更大的探索空间:做 Infra 的人在 CPU 时代不会在芯片层面想工作;到 AI 时代能做很多系统层面的事;到 Agent 时代要做更不一样的系统 * 当下,整个研究范式都在工程化: 「工程化研究范式」是这一代 AI 的隐藏画像 * Transformer 架构统一之后,各家拼的其实是工程能力 * 「算法工程师」的时代结束了,「AI 系统工程师」的时代开始了 * 「今天你用工程的方法去解决更多、更广泛、更复杂的问题」 加入听友群⬇️:

63分钟
20k+
3周前
80.与梅涛院士的 3 小时访谈:语言、视频、具身终将汇聚,为什么是世界模型?

80.与梅涛院士的 3 小时访谈:语言、视频、具身终将汇聚,为什么是世界模型?

卫诗婕|商业漫谈Jane's talk

从语言大模型,到多模态至全模态模型,再到走向世界模型… 世界正在经历什么? 本期节目我邀请了加拿大外籍院士、智象未来 Hidream的创始人梅涛,还原视频生成模型的技术发展史。 梅涛院士是全球首篇文生视频论文的作者,也是最早探索文生视频的人。 2026 年 5 月 20 日,Google I/O 大会上,Pichai 发布了 Gemini Omni —— Google 第一个原生「any-to-any」的全模态模型:文本、图像、视频、语音都在同一个 Transformer 里原生流动,不再是几个模型拼接——这与梅涛一直以来的主张不谋而合。 与此同时,OpenAI 悄悄砍掉了 Sora 项目,更多聚焦 Coding——硅谷正在做减法。 但中国一侧的多模态战场却没有收敛,从多模态、全模态到世界模型,多模的架构层面正在发生一轮新的分化:DIT、UIT、Omni 各自赌不同的路。 梅涛,作为最懂视频模型的人之一,正是选择从底层架构下场的创业者,他致力于打造「视频界的 Anthropic」。 我们从他的中科大、微软亚研院岁月,一路聊到这场世界模型的创业之旅。梅涛的模型世界观可以用一句话精炼,那就是: 图片是入口,视频是过程,世界模型是终局。 语言、视频、具身,终将汇聚。 这期的信息量极大,但技术门槛较高,不过,其中穿插着大量生动比喻,跟随下来,也能对当下的AI 趋势进行一场深入的了解。推荐大家收听~ 本期嘉宾:梅涛(加拿大工程院外籍院士、智象未来 HiDream 创始人) 本期 Shownotes: 03:35 视频领域的 Anthropic :图片是刀, 视频是过程 * 学 Anthropic 的三件事: 团队从 OpenAI 出来后极度稳定(智象核心作者从 2017 年起就没走过一个)、坚定做企业服务、通过开源建立自我逼迫的创新节奏 * 视频领域的刀是图片 : 图片是二维/三维信号的入口,今天客户在平台上创作的时间 50%-60% 花在做一张图上 * 多模的成长路径:图片模型 → 视频模型 → 全模态模型 → 世界模型 * 能不能把图片做到全球最好,是视频公司真正的分水岭:Google 的 Veo 3 之所以强,是因为 Google 本身有很好的图片模型 08:25 院士里少有的「躬身入局」:全职 20 年的工业界履历 * 中科大→微软亚研 10 年→京东探索研究院 5 年→2023 年创立智象;从没拿过第二份薪水,始终全职 * 导师张宏江的习惯:看汇报从最后一页往前翻,5 分钟就把半小时的 slides 看完 * 「用 AI 分析理解视频」的任务,跨越 6 年才完成——多模态、全模态、世界模型都是那份实习任务的延长线 * 好的 mentor 给的 assignment 都不是「当下能做出来」的,而是「你的整条职业生涯都要围绕它推进」的 * 反人性才能获得长久的正反馈,负反馈也是正反馈 * 微软亚研院的土壤:这样的 R to D 通道今天几乎绝迹 29:00 微软 R&D 分离 vs OpenAI 融合:今天模型就是产品 * 微软时代:研究员做 paper → 10 个工程师转化成产品 → 100 个工程师做产品化,大半年才能进产品线 * OpenAI 这一代:researcher 和 engineer 完全融合,R&D 之间不再有转化层 * 研究员今天为什么这么贵——因为他们直接是产品线;研究判断本身就是产品判断 * 如果你的研究和工程仍是两个团队,你比大厂慢的不是资源,而是决策速度 31:27 AI 不是足球赛而是篮球比赛:第一节快结束了 * toC 是 toB 的放大器——C 端最先感知模型能力的溢出、贡献社区反馈、做 branding * 中国 AI 创业的三个关键词:全球化、出海、软硬件一体 * AI 的四节比赛:大模型比拼、 agent(通用+垂直)、终端流量入口/软硬件、第四节待定 * AI 时代,toB 和 toC 的边界越来越模糊:创业公司不必二选一 * 后面的迭代周期会更短:基模半年一次大迭代,Agent 可能三个月一次,终端和交互还会更快 42:15 Sam vs Dario:一号位视角 vs 单点技术执念 * Dario 是理想主义者(读社会学、历史、哲学);Sam 是投资人出身,更现实 * 讲宏大叙事等不到爆发那天就会死 * 中国投资人的三重反射弧——需要沿途下蛋、追共识不追共识外、经历过 toC 时代所以对 toB 天花板有本能的低估——这些都改变了中国创业者能选的叙事结构:你必须在讲远期愿景的同时不断证明近期商业化 * 「长期看 Anthropic 和 OpenAI 的曲线一定会交织」 47:10 从 TGANs-C 到 UiT:做视频模型,创业公司为什么必须换架构 * 做出全球第一篇文生视频论文 TGANs-C (2017):使用 GAN 与卷积神经网络,只能生成约 3—4 秒、48×48 像素的模糊视频,但证明了文本可以反向生成视频 * 视频生成模型经历了 GAN、Diffusion、DiT 几轮架构变化:主干网络从 CNN 换成 Transformer 后,模型才获得更强的上下文和规模化能力 * DiT 需要先把文字、图片和视频压进隐空间,再编码、解码;压缩会损失细节,也让像素级控制变得困难——字节等大厂可以在此基础上大力出奇迹,但始终有些事做不到 * 智象在探索的UiT: 尝试取消外部 VAE,让原始像素、文本 Token 和任务条件进入统一空间,直接完成跨模态交互 * 创业公司必须思考如何避开大厂的车辙,如何优化成本曲线,逼近大厂的优势 * 「架构上的领先只能持续六个月」:开源是一场持续创新考试 * 为什么视频模型目前仍然是创业公司玩得起的游戏?千卡级训练仍给创业公司留有窗口 01:17:15 像素没有统计意义:多模态还在 GPT-2 阶段 * 语言是经过人类数千年压缩的结构化知识,而视觉信号缺少公认的 Token 定义,「像素没有统计意义」 * 文本可以用 next-token prediction 自监督训练,图像和视频通常需要成对的内容与高质量描述,监督成本更高 * 视觉 Scaling Law 会出现,但不一定复刻语言模型的路径;数据、算法和算力都还没有形成统一范式 * 目前视觉不负责产生智能,而在于复刻 * 多模态消耗数据的速度仍赶不上人类产生视觉数据的速度 01:27:50 世界模型不是一个模型:三条路还没有交汇 * 杨立昆的 JEPA 路线关注 next state 与世界状态预测;李飞飞更侧重 3D 世界重建;视频生成派则希望从海量真实视频中学习物理规律 * 视频模型的数据更通用、参数体量更大,可以成为世界模型的基础底座,再向具身或交互式任务迁移 * 图片、第三人称视频、第一人称视频和具身真机数据各自覆盖不同分布,单靠真机数据很难获得足够泛化 * 生成与理解目前仍是两套路线,真正的大一统架构尚未出现。 * 世界模型现阶段更像一组不同目标、数据和训练方式的模型家族。具身、3D 和视频都只是路径,过早把它们压成一个答案,会遮住真正的架构问题 01:41:16 从微软、京东到 HiDream:创业没有标准答案,在迷雾中寻找航向 * 通用视频模型底座的商业化 * 技术创业选赛道时,「未来足够大」还不够。能否沿途形成收入、数据和产品反馈,决定团队有没有机会等到终局。 * 判断模型是否真正创新,不能只看公开榜单;模型公司会用自己的测试集和极限 Prompt 检查边界能力。 * 好的 Leadership :清晰目标、可执行路径、利他和技术使命感 * 快速不仅指把正确路线跑快,也包括更早承认路线不对 02:08:53 通往世界模型:下一代架构可能已在萌芽 * 从多模态、全模态走向世界模型是通向 AGI 或 ASI 的必经阶段 * 当前的 Transformer 未必足以承载所有模态和交互,下一代架构可能已经在萌芽 * 让博士生和研究员持续筛论文、做小规模试错,再把有潜力的方向放大到产业级训练 * 发现下一代架构靠的不是一次灵感,而是一套持续感知机制 02:19:34 世界模型不等于具身:图片是扎马步,最大的数据量目前来自视频模型公司 * 自动驾驶、视频、3D 和机器人都有各自的世界模型叙事。 * 智象的「具身世界模型」路径:先把图片质量做高,再扩展视频长度、实时性和可交互性,最后延伸到高精度的物理世界任务。 * 「像智象这样的公司,一年都是 100 PB 级年度视频数据」:视频仍是当前最可规模化的物理世界信号 * 图片不是视频模型的过渡版本,而是最低成本的基本功测试——构图、像素控制和角色一致性做不稳,视频越长,错误只会被继续放大。 02:28:49 多模态商业化:智能未涌现,表现力先变现 * 「多模不会一家独大」 * Agent 的价值不只取决于基模,还取决于 Harness、Skills、成本控制和行业 know-how * 多模态还没有出现语言模型式的智能涌现,却已经出现表现力涌现。商业化可以早于技术终局。 * 「Token 将来价值会越来越薄,因为它成为了一种 commodity。」 02:42:06 船票的本质:模型能力与商业化都要过关 * 一张多模态船票首先要求自研模型和公开可验证的能力;只有应用收入,也可能被下一轮模型升级吃掉。 * 模型层竞争是耐力赛,但资本耐心有限 * 2024—2025 年,一批视频创业公司批量退出牌桌 * 一级与二级市场都在寻找模型排名、对标逻辑和增长数字,但对「新型 toB」的共同要求,是不要回到私有化部署和定制研发。 02:54:55 卖铲子给具身:从世界中学习,再重构世界 * 智象与诺亦腾合作: 具身公司缺少高质量、可规模化的数据 * 把真人遥操和夹爪数据扩增为不同背景、不同手部外观的第一人称视频 * 合成数据是否「真实」并非重点,重点是它能否提升 VLA 或 World Action Model,并用轻量模型量化能力增量。 * 通用世界模型仍缺数据、架构和算力,把触觉、温度、空间、时间、语言与动作放进同一模型,可能需要今天 10—100 倍的计算资源。 * 图片是入口,视频是过程,世界模型是终局 * 「我希望能够从世界中学习,把世界进行重构。」 --- 欢迎前往视频版,对照字幕获得更好的吸收。也欢迎关注公众号「卫诗婕漫谈 Light the Star」,查看访谈文字版整理。 加入听友群、关注「漫谈 Light the Star」的全网账号 👇

202分钟
19k+
4周前
79.机器人大脑第一股上市,与仙工赵越的4小时访谈:全球第一、机器人金字塔与具身智能的另一条路

79.机器人大脑第一股上市,与仙工赵越的4小时访谈:全球第一、机器人金字塔与具身智能的另一条路

卫诗婕|商业漫谈Jane's talk

这是一期非常生动、系统的访谈,还原了一家隐形冠军的成长史与思维方式。 作为机器人大脑第一股(仙工智能已于2026年6月24日在香港交易所主板挂牌上市),仙工把机器人的大脑「控制器」卖向全球,成为全球出货量第一。同时,它也正在探索一条反主流叙事的具身大脑道路。 这是仙工成立以来及上市后,创始人首次接受深度深度访谈。此前,这家公司作风低调,鲜有接受媒体报道。 创始人赵越身上有许多有意思的故事:读医三年后退学重考、本科期间睡实验室、曾带领团队获得三届 Robocup 全球冠军、首次创业失败…… 大量成长过程中的趣事(尤其是在世界杯期间,我们聊机器人世界杯 RoboCup 聊了一个多小时),其实也与创业过程中的思考方式互文。 赵越带来一个有趣的暴论:未来所有公司都可以是机器人公司。也带来一些启示:越是纯粹的人,越有机会在专业领域获得成功。AI 时代,足够热爱的人将有更大机会获得成功。 强烈荐听这一期,希望你们喜欢:) (本期访谈的视频版已在 视频号、微博、b 站、小红书等平台登录,欢迎前往观看~) 本期嘉宾:赵越 (仙工智能创始人) 本期 Shownotes: Part 1.关于赵越:史莱姆、「卡拉米」和永远想「掀桌」的基因 01:23 仙工的吉祥物,是小怪物「史莱姆」 * 「开始都叫老板,新人一周内就会喊我越哥」 * 史莱姆(仙工吉祥物),最初级但也不容小觑的小怪物! * 从 wrong 到 right,要经历漫长的混沌 * 创业本质就是不停解决问题的过程 * 「加速开放多元的智能文明,让智能机器没有门槛」 06:26 湖南邵阳,浙大 8 年医学本科、退学,与夺冠少年 * 父母都是老师,「他们最大的贡献就是不管我」 * 浙大竺院的宽口径培养:8 年医学制,读到第五年,我退学了 * 白天紫金港,晚上玉泉——本科研究生几乎睡在实验室,不认识研究生室友 Part 2. 中国摘得 RoboCup 世界首冠:一个「小胖子」带队夺得三届冠军 15:15 从「小胖子」Picker ,到三届全球冠军 * 关于 RoboCup:2050 年击败人类世界杯冠军 * 还没有 Issac 和 Sim2Real 的年代:用 ODE 物理引擎 + CUDA 加速做仿真 * 8 毫秒决策周期、集中式控制场上 6-7 台机器人、GPU 算所有跑位与形势变化 * 2009 年开始接触强化学习,「逐条过对手的比赛日志」 * 代码里的 magic number(阈值数):引入随机性,是最有效的策略(今天的创业同理) * 「那个小胖子,你不要在场地上跑那么快!」 * 小卡拉米的蜕变规律:脱颖而出,往往不是因为优秀,而是因为热爱 30:14 中国首冠 & 一个「思想钢印」 * 初赛击败上一届冠军:整个场馆都震惊了 * 一个思想钢印的诞生:「你觉得是问题的、迟早有一天会找过来」 * 击败 CMU(卡耐基梅隆大学,机器人领域全球最强的实验室):把不可预测,转化为可预测 * 「太精彩了,不像机器人在对抗,像两个教练在对抗!」 * 与 Malona 在巴黎的会面(RoboCup 发起人之一,执行委员会主席):RoboCup 播下一片种子 * 热爱,无法伪装 Part 3. 未来,B 端不会有真正的机器人巨头出现:每一家公司都可以是机器人公司 53:21 机器人金字塔:能在底层解决的,不要往上层解决 * 机器人金字塔:机械 → 电子电路 → 底软 → 通讯 → 算法 → 模型 * 端到端 vs 分层架构的技术路线分歧:未来所有大脑模型,也会是 MoE 架构 * 自上而下 vs 自下而上的两派大脑 * 快速分裂 & 快速共识:2022 年大家讲 VLA、2024 年讲世界模型、2026 年讲无本体采集——共识每年重新洗一遍 * 具身分两维度看:**新技术范式 vs 新产品形态**——可以分别独立验证、没有必要绑在一起 * 数据如何低成本、可持续地涌现? 01:06:23 暴论:「所有公司都可以是机器人公司」 * 渐进式在 B 端赢、颠覆式在 C 端赢 * 「一吨货的三种解法」 * 工具是被人创造的——让人形去搬货,就像让自动驾驶去开油车,是退步 * 数据 ≈ 模型:一个拥有足够多好数据的公司,可以立于不败之地 * 好数据的三条件:① 真实场景采集的多样性 ② 天然对齐(不用花大量成本转格式) ③ 低成本可持续产出 * 仙工的独特资产:2000 种机型 × 400 种传感,接在自家传感器上,天然对齐;客户异常时主动把 corner case 给你 * 为什么不立刻训一个通用大脑,而是训垂类模型? * 产线没有巨头、机器人为什么一定要有标准的巨头? * 构建事实标准,与「反者道之动」 01:22:38 从方法论焦虑,到数据坚定 * 「现在这些 BP,没有 VLA 的我都不看了」 * 问题不是方法本身、而是数据 * 自动驾驶出身的,都会强调真机数据 * 新方法研究,是一个沿途下蛋的过程 * 挖角潮有感知,核心员工几乎没走 * 无为,是不妄为 01:53:16 第一段创业的失败:富士康点醒了我们 * 第一段创业「仙知」:沿着机器人四大家族一路模仿,发现似乎不对 * 富士康点醒我们:除了控制器,没什么是我们不能做的 * 与富士康的交易:交出图纸,买你系统 * 一台机器人上难以被统一的需求:当你把它升维到软件工具链层面,都能被统一 * 第一段创业的教训:现金流危急一年多 Part 4. 仙工的具身大脑路线:不立刻去训通用大脑,掌握数据会利于不败之地 02:10:00 机器人平台化战略的诞生:脏活累活,是护城河 * 控制器就是机器人的大脑(硬件承载 + 软件规则或模型) * 仙工如何成为机器人控制器全球第一? * 能不做的,都不做 * 海外市场与中国市场的差异 * 我们组建了一整套严选和评测体系 * 我们不做零件的原因:中国公司太厉害了,未来第一名不会有中国以外的公司 * 脏活苦活,才是一个科技公司真正的壁垒 02:36:19 谨慎做梦:可靠性、泛化性 & 后发优势 * 战略是长期的、不可撤销的投资 * 具身的实用主义:一端要可靠性(强化学习把场景打到极致),一端要泛化性——「两端兼具,至今我没看到信服的案例」 * 每次从 0 到 100,是为下一次从 0 到 1 换筹码 * 谈具身落地的真相:「大多数应该是不及预期的」 * 仙工的具身「四象限理论」:把「新旧技术」× 「新旧产品形态」拉出四个象限 新技术 × 旧产品形态(比如叉车具身化)——做落地引领者 旧技术 × 新产品形态(人形机器人的下层运控)——做具身行业的赋能者 新技术 × 新产品形态(比如具身大脑训自己的通用模型)——当下不做,全力积累数据 旧技术 × 旧产品形态——放弃 * 关于人形:不是没价值、是这套「基于数据训模型」的范式在人形上暂时难落地 Part 5. 道德经、鲁路修与稻盛和夫:「干掉第一」、「成为第一」、「不做第一」 * 《道德经》的「空」,与不妄为 * 「功成事遂,百姓皆谓我自然」 * 稻盛和夫和毛泽东:极致唯心 + 具体唯物的辩证 * 钢炼、鲁路修、高达、进击的巨人:神漫里有着美好的世界观 * 鲁鲁修震撼了我的世界观:主角让自己变成世界最大反派、被最好的朋友一刀刺死,用自己献祭了正义 * 消消乐哲学:做到第一就要清空重来,否则容易变成那条恶龙 加入听友群⬇️:

226分钟
22k+
1个月前
78.Seedance之后,视频Agent何去何从?|与 OiiOii 闹闹聊视频模型的秘密:数据、生态与感性的结构化

78.Seedance之后,视频Agent何去何从?|与 OiiOii 闹闹聊视频模型的秘密:数据、生态与感性的结构化

卫诗婕|商业漫谈Jane's talk

Sora 之后,Seedance、可灵等国产视频模型,做出了世界的高度——中国视频模型为何能领先全球?Seedance 的发布(最新已经是 Seedance 2.5 的发布啦),究竟是结束了视频 Agent 的战争,还是开启了它? 我和 OiiOii 创始人闹闹,一起还原了属于视频战场上的大模型及智能体之战。 (本期内容详细梳理了 Sora 之后,视频模型的发展,及视频模型训练背后的人才体系、训练方法、数据奥秘,非常值得一听,也欢迎前往各大平台-B 站-小红书-视频号等,搜索本期内容的视频版😁) 从腾讯微信、字节剪映到创立 OiiOii,闹闹特别分享了她的产品世界观——感性与理性,是一体两面。而在视频这个领域,感性如何被量化,既是科学,也是艺术。 本期嘉宾:闹闹(视频 Agent OiiOii 创始人,前字节剪映负责人) 本期 Shownotes: 02:01 Part 1. 闹闹的成长史:观察者、群体之外与"创造环境" * 当一件事需要你自己去创造一个环境 * 腾讯和字节是产品观的左右脑 * 张小龙的 8 小时内部产品演讲,"他用人类外的视角在观察人类——把人性的善和弱点放在放大器里发酵,再像园丁一样修剪” · 在字节学到数据的应用,也看到数据的滥用——明知一个实验数据怎么才能为正,就为了正而去做它,但这不代表它长期是正的 * 内容型产品的核心,是把感性的好与不好归类量化 18:27 Part 2. 视频模型路径的判断:从 Sora 2,到 Seedance * 早期视频模型以首尾帧为主——Vidu 第一次把“多参考图"这个概念做出来 * Sora 2 验证了多参方向,开拓了模型的想象力 * “Seedance 基本是 Sora 2 的升级版” * 什么是视频生成的最佳实践? * “描述词要加正向和负向词,要叠加约束” * “视频生成交互的下一步不一定是文字” 27:28 Part 3. 为什么最好的视频模型出现在字节快手这样的短视频平台? * “视频模型不是创业公司该做的” * 大公司的数据护城河:有过去做图形图像算法的积累,可以制定标注标准,执行到八九十分 * 可灵的前世今生:2021 年,快手 Y-tech 算法团队在视频理解上就不弱于(甚至强于)字节 AI Lab * 两条视频模型路径:通用大底座(Seedance) vs 专业领域优先(可灵) * 生态是分水岭:同样的算法,能不能用好这些数据,取决于过去推荐系统里有没有相关应用经验 * 中国为什么能在视频模型方面领先? * OpenAI Sora 的失败不是技术失败,是生态失败 * 视频模型领域的护城河不是算法,是"数据标注标准 + 组织执行力" 34:15 Part 4. 模型不会被吃掉 Agent 的部分是?harness & 感性 benchmark * 视频模型目前的不可能三角:效果、生成时间、生成成本 * 模型会往哪些确定性的方向迭代? * 多模和语言模型有哪些本质不同?——感性可以被结构化但颗粒度更粗 * Harness 一定会进入多模和视频领域 42:33 Part 5. AI 时代的「剪映」(or not ):第二次创业为什么是 OiiOii ? * AI native 的产品需要新形态 * 关于创作者的物质激励 & 精神激励 * 动画是 Agent 适合进入的绝佳行业 * 模拟剧组:OiiOii 的 7 个角色、改变生产组织、抽卡降本 * 内测码 10 万人排队的原因 * Seedance 给我的冲击有哪些 * MidJourney 没被吃掉的原因 * OiiOii 的产品团队,由谁构成 57:02 Part 6. Sora 关停与 Seedance 2.0:视频 agent 战场是终结了,还是开启了? * Sora 关停——它做错了什么? * Seedance 2.0 是升级版的 Sora,它的弱点是什么? * 海量视频 agent 涌现是"妄想"?——哪些套壳在骗钱? * 怎样的产品是“纯套壳”?鉴别 Agent 的厚度… * 视频领域不会 winners take all … * 为什么抖音特效的参考意义极大… * ACG (动画、短漫剧、游戏)的 Agent 机会:生产关系的改变才是更值得思考的价值空间 * 我与字节:「你要相信字节是一家非常精明的公司…」 * 如何侦查模型厂商动向? 01:32:18 Part 6.「这个时代最缺的就是谦逊」 * 模型涨价了怎么办? * 国内 agent 调度的视频模型有? * Seedance 最值得学的是什么? * AI 时代顶级产品经理画像长什么样? * AI 时代的自信与盲目 如果喜欢「漫谈」,欢迎加入我的听友群~⬇️

105分钟
15k+
1个月前
77.有关智元、觅蜂的愿景与野心,和具身智能的竞速之旅|与姚卯青的对谈

77.有关智元、觅蜂的愿景与野心,和具身智能的竞速之旅|与姚卯青的对谈

卫诗婕|商业漫谈Jane's talk

2026 年,具身智能成为了聪明人扎堆、资本热潮近乎疯狂的行业。这条热门赛道中,智元机器人是最早的百亿俱乐部成员之一。 在人形机器人出货量狂奔的路上,智元的野心并不止于“具身本体”的军备竞赛。今年,他们做出了一个让全行业瞩目的反哺举措:将旗下的核心数据资产彻底剥离,独立孵化了全球领先的一站式物理 AI 数据服务平台——“觅蜂”。 本期嘉宾姚卯青,不仅是智元合伙人、具身业务部总裁,也兼任觅蜂的董事长兼CEO。这期播客在五月觅蜂发布会后录制,或许是有关智元战略的,最深入完整的一次访谈。 (本期视频的微博开屏页,欢迎前往微博等平台观看视频版~;也欢迎前往公众号,查看「漫谈Light the Star」访谈的文字版~) 从Waymo到蔚来再到智元,姚院亲历过自动驾驶从概念到量产的全过程,他说“今天的具身智能连GPT1都没到”,而机器人离真正涌现智能,还差一亿小时的数据。 本期嘉宾: 姚卯青(智元合伙人、通用业务部总裁, 觅蜂董事长兼 CEO) 本期 Shownotes: Part 1. 02:40 关于姚卯青:从清华电子系到南加大,从 Waymo到蔚来 * 「人间清醒」与「顺势而为」 * 清华电子系的系统训练:电路、通信、信号处理、计算机视觉、编程和算法,都是自动驾驶和具身智能的底层能力 * Google Display Ads 团队:计算机视觉、NLP 与 Transformer * 内部转岗 Waymo:可能是当时全球最难的面试 * Waymo 的三年: Robotaxi, 从技术 demo 走向商业化运营 Part 2. 17:28 蔚来的量产课:激光雷达、车规体系和数据飞轮 * 为什么选择蔚来? 「单平台、全标配」的产品策略,激光雷达、4K 相机和高算力硬件一体的统一底座 * 蔚来李斌:「被人骂也是被记住的一种方式」——做关键决策需要勇气 * 多模态融合感知、激光雷达感知、BEV、Occupancy Network、AEB …关于自动驾驶的种种 * 选择回国:相比 Waymo 的几百辆 Robotaxi,国内乘用车百万级保有量所带来的数据分布和 corner case 密度,是完全不同的飞轮 * 量产经验到底是什么?「不是把样机多复制几台,而是项目、研发、测试、供应链、质量、版本和数据闭环的组织能力。」 * 能迁移到机器人的是什么?异常数据回流、模型迭代和现场版本下发 Part 3. 28:31 当自动驾驶派进入具身:优势不是算法,而是底座 * 自动驾驶派进入具身智能,最大的价值是理解强电系统、供应链、质量、量产和底层软件稳定性 * 机器人和车,在电子电气架构、操作系统、中间件、传感器输入到电机控制等底层工程上高度相通。 * 车就是最简单的机器人?「有点牵强」 * 在很多低速场景中,机器人反而更有机会部署 VLA、世界模型等前沿模型 * 真正稀缺的人才,不只是刷榜或发 paper 的人,而是上手修过 bug、和硬件软件都打过仗、能把复杂系统跑稳定的人 * 具身创业的三大派,都有不可替代性 * 机器人终局架构不会只是「快慢系统」两层,可能包含: 1000Hz 底层控制、10 到 20Hz 动作规划、1 到 2Hz 阶段目标规划,以及更高层的 Agent 长程推理。 Part 4. 35:19 讲「基模」太早了,具身连 GPT 1 都没到呢! * 「2026 年了,具身智能到底到 GPT 几了?其实 1 都没到呢」 * 「现阶段的真机数据量,和真正支撑基座模型涌现的数据规模,还差四五个数量级」 * 很多公司强调自己做「具身基模」,是借用了大语言模型时代的资本叙事 * 今天的具身更像 Transformer 和 BERT 早期,而不是 GPT-3 之后 * 数据的关键不仅是「量」,还包括信息维度、场景种类、失败样本和真实部署中的边界样本 * 多模态融合是必然趋势,视觉远远不够 * 真正的瓶颈不是算法是否足够聪明,而是真实世界数据的量、模态、场景和失败样本远远不够 Part 5. 49:59 有关智元最完整的战略揭秘:一家 AI 公司,而不只是机器人公司 * 神秘的邓泰华其人 * 智元Day 1 定位成 AI 公司,而非单纯的人形机器人公司 * 人形机器人是把 AI 带入物理世界的必要载体,但不是终点 * 「智元确实是这个行业里最有野心的公司之一」 * 智元的组织架构、融资节奏与股权激励 * 具身公司的长期价值不只在本体硬件,而在能否把「本体、数据、模型、场景」做成闭环。 * 精灵 G2 所经历的完整 IPD 流程:接近 9 个月 * 机器人行业的需求峰谷比汽车更剧烈 * 工业不相信眼泪,最终都是 ROI:「」工业客户不关心你是人形、猴形还是狗形」 * 智元的「358 战略」:从量产、商用到部署 * 具身智能最终不是单点技术竞赛,而是系统工程。 * 当技术路线逐步收敛、场景开始渗透时,先把 90% 的体系能力构建好,才可能真正承接行业机会。 Part 6. 01:55:26 VLA、世界模型和机器人数据飞轮 * 智元的 AI 研发体系:模仿学习、VLA 预训练、世界模型、强化学习后训练和数据闭环 * Google PaLM-E :VLA 来自语言模型和多模态语言模型向物理世界的迁移 * 世界模型更像对物理规律和状态转移的数字化、神经网络化描述 * 「VLA 和世界模型都不是最终形态,未来更可能是分层架构」:前̶者̶受̶限̶于̶语̶言̶和̶动̶作̶之̶间̶的̶表̶征̶鸿̶沟̶,̶后̶者̶仍̶更̶多̶来̶自̶二̶维̶视̶频̶和̶第̶三̶人̶称̶视̶角̶ * :̶语̶言̶推̶理̶、̶物̶理̶预̶测̶、̶低̶层̶控̶制̶、̶长̶程̶规̶划̶和̶数̶据̶飞̶轮̶共̶同̶工̶作̶ * 世界模型的价值在于学习液体流动、玻璃破碎、软体形变等真实物理规律 * 「后训练和失败数据非常关键」 Part 7. 02:08:49 觅蜂:具身版 Scale AI,机器人数据界的「滴滴」 * 投资人的主意:对标上一轮 AI 时代的 Scale AI ? * 具身数据生意比传统数字世界标注难得多 * 2026 :具身数据军备竞赛年 * 模型的差异化暂时不大,数据会是分水岭 * 打造一个公共性质的数据服务平台,一个「阳谋」:客户花钱带来数据需求,平台用数据训练模型,模型再反哺采集、预标注和质量管理效率 * 数据问题都没解决,讲基模预训练、后训练,都是空中楼阁 * 高质量数据的第一点是真实:场景和任务必须足够丰富,能够覆盖生活和生产中真正会遇到的问题 * 规范:相机曝光、画质、设备同步、轨迹重建精度、操作流程都要高标准 * 「脏数据」不是质量差的数据,而是包含失败、偏移、纠错、重新规划和最终成功的多样化数据 * 仿真数据并不天然低价值 * 关键不是流派,而是任务、场景、成功率要求和模型使用方式 * 数据的价格、产能和全球化 * Deepmind 和 Genralist:「如果数据是具身智能竞争的唯一决定变量,中国公司现在就可以宣布他们是赢家」 * As many as possible, as soon as possible(越多越好,越快越好). Part 8. 02:43:43 从数据标准,到 G3-G4 中间态 * 好的数据标准会逐步收敛 * 即使不同机器人硬件不统一,很多数据仍可以被抽象为通用表达,如末端执行器轨迹、二维帧序列、物理状态变化等 * 机器人行业的安全和质量准入标准,会在两到三年内伴随大规模商用逐步出现。 * 从 G1 到 G5 ,当前行业大约处在 G3 到 G4 的中间态 * 预计 2027 到 2028 年行业有希望达到 1 亿小时级数据规模 * 真正类似语言模型那种涌现能力,还需到 1 亿小时级高质量数据出现 Part 9. 02:54:42 最期待的画面:机器人第一次让人觉得「觉醒了」 * 机器人出现真正的 aha moment:不再只是从画面到动作的肌肉映射,而是能在复杂环境里自主规划、理解指令、做出响应 * 涌现时刻大概率发生在实验室,而不是工厂 * 数据会成为这一轮智能化转型关键基础设施,但它比算力更难获取 加入听友群⬇️

178分钟
26k+
2个月前
76.与 00 后创业者源培的访谈:从 RoboMaster 到李飞飞实验室、两次「全球首次」,与自由快乐的非标人生

76.与 00 后创业者源培的访谈:从 RoboMaster 到李飞飞实验室、两次「全球首次」,与自由快乐的非标人生

卫诗婕|商业漫谈Jane's talk

AI 原生一代,将写下怎样的新故事。这是这一轮 AI 浪潮以来,投资人们最关心的问题。 今天的访谈嘉宾,是 00 后具身创业者,陈源培。 他曾在斯坦福李飞飞的实验室,实现了全球首次双臂长程灵巧操作,以及全球首次「用人类数据训练机器人双臂灵巧操作」。 土木工程本科出身的他,高考前一天还在打游戏,却通过 Robomaster的比赛结缘机器人,并跨界师从北大强化学习专家杨耀东,成为强化学习的前沿学者,继而进入斯坦福李飞飞的实验室,做出全球首创的成果。 相比「天才少年」叙事,这期更值得品味的,是一个一再印证,学习没有固定范式、创新没有标准答案的故事。以及开放、多元、包容和谦卑的学术品味与视野。 无论游戏、RoboMaster、科研,在源培那里都有一条共同线索:它们都像升级打怪,靠快速学习、持续探索和反馈提升能力。希望其中的思考方式,能给大家启发。 (本期视频欢迎前往 b 站、视频号、小红书、Youtube 等平台观看~) 本期嘉宾:陈源培,灵初智能联合创始人 本期 Shownotes: 02:51 从游戏到 RoboMaster:工程能力从系统里长出来 * 高考前还在打牌的 00 后:通宵打游戏,差点被选去电竞青训 * 父母最大的影响是「完全不管我」 * 大疆 RoboMaster 冠军:机械、电控、嵌入式、上位机、控制、算法…训练的是复合能力 * 深入代码底层,不会并不是一个门槛 * 机器人并不是单点算法问题,全栈系统思维是稀缺的 * 工程性的东西,更多看的是细心程度与快速学习能力 * 俄乌战争给源培的「觉醒」——突然觉得发 paper 、抠创新点,对世界没什么帮助 16:41 师从杨耀东,最早 Isaac 使用者与并行仿真 * 师从强化学习知名学者杨耀东,用强化学习做灵巧手 * 零帧起手强化学习 * OpenAI 的 Shadow Hand (2019)的解散,强化学习解魔方——酷但昂贵 * 「我是英伟达 Issac 最早的使用者」「那个版本应该绝版了」 * 「未来用 GPU 做仿真,一定是大势所趋」 * 首篇论文即震撼行业:高自由度操作可以在大规模并行仿真中训练出来 35:05 强化学习 vs 模仿学习,什么是训练直觉? * 强化学习的峰回路转:监督学习和模仿学习的短期效果让强化学习一度被质疑;直到O1 等方向又重新证明了强化学习的价值 * 模仿学习见效快,但泛化弱;强化学习潜力大,但极吃 Know-how * 模仿学习不是未来 * 从人手中心到物体中心:描述物体轨迹如何变化,让机器人知道大致目标,再在小范围里探索 * 奖励不需要把每个动作写死,需要留有空间任 AI 自己探索 * 真正的系统能力是「方法都告诉你了,但你调不出同样效果」 * 我训强化学习还挺厉害的:「基本上大家以前都看曲线,只有我是打开仿真,盯着机器人学习。」 43:37 进入斯坦福李飞飞实验室:从强化学习中心主义,到多元的学术视野,与技术地图 * 每条路线都有价值,未来更可能是吸收各自优点的融合过程 * 更开放的研究氛围:连接图形学、灵巧手、模仿学习、人类数据 * 师从 Karen Liu :把机器人操作、动捕、人类数据和仿真强化学习连接起来 * 不要太 Ego,不要靠形容词证明强,让结果本身说话 * 一周可以水一篇顶会的代价是放弃自己其他可能性 * 「从斯坦福回来后,他像变了个人一样」 50:51 跳出舒适区 + 螺旋上升的具身技术史 * 具身技术发展的螺旋:抓取→ CV+模板 → 直接学轨迹(模仿)→ 人遥操太慢 → 强化学习自己探索 → 仿真效率低→ Isaac Gym 并行仿真+Sim-to-Real → Sim2Real Gap 太大→ 软体场景模仿学习反超(Diffusion Policy/ACT)→模仿学习也不够→ 后面接强化学习→世界模型起来后,又回到仿真训 RL * 灵巧手最大的价值,不是因为它像人,而是因为它最容易吃下人类操作数据 * 与夹爪或专用末端执行器相比,五指手和人手之间的 Embodiment Gap 更小,更适合做 Human-Centric 数据采集 * 「以物体为中心」的通用表征:操作的本质是让物体沿某条轨迹发生变化,而不是复刻人的每个关节动作 * 具身 Scaling Law 的核心可能不在遥操数据,而在人类日常操作数据; * 硬件形态本身会决定能吃下什么样的数据 * Sequential Dexterity 的祛魅:学术需要 novelty,这没太大意义 58:26 仿真派的价值和上限 * 我曾经就是个仿真派 * 仿真无法根本解决真实世界复杂交互,尤其在软体、碰撞、接触和高精度成功率方面 * 可微仿真和世界模型都试图缩小 Sim2Real Gap,但目前仍受限于算力、图形学、物理交互和数据量 * 仿真 vs 真机,谁快?仿真的场景 Scaling 能力未必比真实世界快 * 仿真可以做出很 Fancy 的 Demo,但不是当前可见的终局 * 如果世界模型足够强到生成全场景仿真,它本身也需要先吃下海量真实数据——如果做出了世界模型,那肯定先做出了好用的 VLA * 一个研究者最重要的能力不是在舒适区里把"已经会的事"做得更深,而是逼自己跳到不熟悉的方向;这一点反人性反惰性,因为你在擅长的方向也确实有想探索的东西 01:17:02 具身 Scaling Law 会撞上硬件问题 * 具身 Scaling Law 的核心问题是数据,单靠遥操数据很难堆到足够规模 * 百万小时级别的人类中心数据,至少能让行业看到一些效果 * 「我是实用主义派」 * 与语言模型不同,具身智能会遇到硬件差异:不同手、不同本体、不同自由度都会影响数据和模型泛化 * 跨本体泛化的关键,是提取人类操作中通用的信息,再用强化学习补足机器人具体关节、力和接触细节 * 语言模型可以在统一的 token 空间里 Scaling,具身智能必须同时解决数据规模和硬件本体差异 01:22:12 创业后的路线选择:先坚定,再快速调整 * 2024 创立灵初时,市场上很少有人强调灵巧手操作和强化学习 * 择做长程灵巧操作、强化学习、人类中心数据和双手路线,对于一家创业公司,是信仰和耐心的考验 * 要去做别人做不到的事 * 当前的路线没有不能复刻的,都不够本质:但仍然保持灵活,可快速调整 * 具身创业的难点是同时平衡商业化和预研,短期场景可以做,但公司不能忘记自己到底是不是模型公司 * 「你不能有包袱,最后还是结果说话。」 01:38:04 世界模型、VLA 和算法口号的泡沫 * 灵初的具身大脑是糅合路线:硬件、采集、数据处理、模型训练和部署,形成端到端闭环 * 模型架构和口号本身不是护城河 * 广义 VLA 只要输入视觉和语言、输出动作即可 * World Action Model 也只是增加未来帧预测等辅助监督 * 单靠改模型架构、模块连接方式就带来突破性变化,我认为这几乎是不可能的 * 真正重要的是训练范式、数据规模、数据质量和完整 Infra * 马斯克为什么不喊世界模型——世界模型本身不产生价值,真正产生价值的是它能否在具身、能源、航天或其他真实任务中解决问题 * 具身行业的泡沫:太多人说的和做的不一样,一些投资看不太懂 01:45:05 主动世界模型:从数据里选择有用信息 * 关于「主动世界模型」的思考:机器人需要主动判断哪些信息有用,哪些是噪声 * 世界感知分成客观世界规律、主动选择机制和自身 Policy 三层,其中最缺的是中间那层主动选择 * 数据 Scaling 不是无脑加数据,低信噪比数据可能损害模型能力 * 我是实用主义:脑科学、神经元结构、主动世界模型等想法都可以借鉴,但必须通过效果验证 * 具身下一阶段的底层创新:可能不是继续堆模块,而是找到类似语言模型 next-token prediction 的训练范式 02:03:15 「我的人生,绝对不可能不快乐!」——兴趣、非标与系统性思维 * 不要害怕环境、专业或起点带来的限制,去做自己真正感兴趣的事 * 机器人人才,最重要的三点:追求卓越、系统性思维、不要太 Ego * 「再垃圾的 paper,也有你可以学习的点!」 * 「我追求的是影响力,对真实世界产生价值的影响力」 * 未被验证的人才和未被验证的路线,可能写下真正的突破 加入听友群⬇️:

134分钟
13k+
2个月前
75.登顶大摩全球人形机器人报告,灵初凭什么代表中国?|与创始人王启斌聊「灵巧操作」

75.登顶大摩全球人形机器人报告,灵初凭什么代表中国?|与创始人王启斌聊「灵巧操作」

卫诗婕|商业漫谈Jane's talk

2026 的上半年,中国资本市场围绕具身进行了大规模的布局,将具身大脑这个赛道推向了前所未有的热度。 这期的嘉宾灵初智能,刚刚登顶了摩根士丹利最新发布的《全球人形机器人研报》,它被视作中国具身大脑阵营的核心代表之一。从灵巧操作出发,这条大脑路线直指智能的上限。 创始人王启斌是 70 后产品背景,乔治华盛顿大学博士,完整经历了"智能设备 → 移动机器人 → 具身智能”的三次范式更迭。 我们的访谈不仅涉及到大量具身行业的真实进展,也描绘了在具身这个早期行业中,从研发(R)到工程(D)到产品(P),所谓 RDP 的全流程。 2024 年,70 后王启斌,和80 后算法老兵柴晓杰、 90 后北大学者杨耀东、00 后天才少年陈源培,组成了灵初智能这支具身“7890 战队”,成为这个行业背景最豪华的团队之一。 (本期访谈的视频版已经登录 B 站、视频号、微博、小红书、Youtube 等平台,欢迎前往观看~,文字版可前往公众号「卫诗婕 漫谈 Light the Star」) 本期嘉宾:王启斌(Viktor)· 灵初智能创始人 本期 Shownotes: Part 1. 00:00-08:56 让机器人「动手」,为什么是皇冠级的大脑问题? * 灵初是谁? 被摩根士丹利视作中国大脑核心代表,灵初是谁? Hugging Face 上 1000 小时多模态数据集下载量第一 希腊字母第 23 个 Psi(Ψ),意指强化学习,「像孩子一样在环境中交互、逐渐长大」 为什么做大脑的公司普遍估值更高? * 什么是通用灵巧操作?为什么说人类操作数据是一座富矿? 操作的三种能力:对任务做长程语义分解(规划)、手眼协同、实时纠错 人类能力的演进顺序:行动最早(灵长类)、视觉次之(寒武纪)、语言最晚——而机器恰好相反 机器人不一定像人类那样大脑/小脑严格分开,目前没有完美的大小脑结构能拟合类人能力 夹爪很难做类人复杂操作 操作知识不具备可传承性——如何把人类经验挖出来变成可训练的数据,是具身要回答的根本问题 Part 2. 08:56-20:04 Why now:具身浪潮,周期与淘汰赛 * 2026,具身为什么更热了? 「新的浪来了」:过去几波范式不会持续这么长 why now 的底层:具身是真正回到物理世界的问题 具身的市场,只会比智驾更大:上一波公司的顶点,可能是下一代公司的起点 跑完一个 cycle 约 7 年:至少会有三轮淘汰赛 * 关于王启斌:黑莓vs苹果,一个产品老将经历的范式更迭 黑莓曾是全球唯一净利率 25%+ 的公司(另一家是苹果) 从苹果开始,ToB/ToC 没有绝对分割 什么是苹果真正的胜负手? 新世界物种对旧世界的降维打击,是如何发生的? 「站在旧世界的人不用 complain,这就是宿命。」 「当年带 Sonos 全球 CEO 见百度陆奇,是我的心结」 什么样的 ToC 产品能击穿 ToB?苹果做到了。具身领域有机会吗? * 20:04 中美硬件之争,穿越周期的产品经理,与审美 审美的物质基础:Jony Ive 的设计传统在英国,小米设计领导人传统在德国,消费电子审美在欧洲 Sonos 和 B&O ——两种产品哲学 小米生态链/IoT 兴起(2015)后,中国消费电子工业设计的崛起&底层:从整机到核心零部件的全链路掌控 + 快速迭代 Part 3. 中美硬件之争,两代机器人公司,谁会赢? * 「美国大脑领先、中国硬件领先」,人们只看到了轨迹的起点 为什么从泛化性居中、节拍较低的物流和服务业 toB 切入 5 年内「只做模型不做硬件」是伪命题——具身现处于软硬深度耦合阶段 落地两种形态:固定上半身、可移动+上半身——两种构型,训同一个模型 具身的数据飞轮和车完全不同——车有存量市场,具身去年头部出货才 5000 台,飞轮必须靠人类数据冷启动 * 上一代自动化机器人 vs 具身新秀派,谁会赢? 上一代移动机器人靠 SLAM(2015 前后)和基于规则的技术,深耕单一场景;当下具身解决更复杂的操作问题,用 learning base 的学习范式,人才完全不同 三个顶层问题:解决什么问题、用什么技术路线、什么样的人才; 创新者诅咒:成熟公司有自己的场景循环,可能恰恰是负担 仓储物流、无人配送领域,全是创业公司赢了(海柔、极智嘉、新石器)——阿里、美团、京东,为什么都落后了? 「原来真的是书上得来终觉浅……谁有场景谁赢,是个错误。」 Part 4. 灵初的成立:7890 战队 & 科学家创业潮 横跨中美,花半年时间找科学家: 国内能做灵巧操作的不超过 10 人 如何判断科学家是否适合一起创业? 在斯坦福李飞飞实验室的 00 后联创:强化学习,将人类数据迁移到灵巧操作的 Sim2Real 「7890 战队」:为什么具身需要的人才跨度大?跨代际和领域的融合难度? 怎样治理一个软硬数据耦合的复杂组织? 为什么「量产那套」不完全适用于具身大脑研发? AI 时代,为什么强调「治理」而非「管理」? 硬件派 vs 模型派的路线分野:从硬件出发(做到稳定便宜规模化,特斯拉思路)vs 从模型和数据出发(用优质数据训模型,灵初思路) Part 5. 01:01:06 具身数据的真问题,与中国的另一种叙事 * 可规模化预训练的优质数据长什么样?数据管线怎么做? 算力、数据手套与数据飞轮:灵初的真实数据方法论 什么是检验真做大脑 or 水货大脑公司的金线? 数据洞察:手的 3D 关节角精确度 > 触觉 > 2D 照片; 全模态数据,比纯第一人称视频更精确丰富 行业最大的10 万小时手部多模态数据怎么来? 数据管线 = 数据处理平台(审核、标注、处理)+ 进训练框架训模型 + 模型反馈 +抽象出数据洞察 * 具身数据乱象:已经出现一些空置的数采场 没有模型需求方牵引,数据采集一定是无序、低效、垃圾场级别的 只有真正在训模型的大脑公司,才有资格定义「需要什么数据」、才能分辨「什么是 garbage」; 「投资人最后看的是这道菜到底怎么样,他并不知道这道菜里头真正用了多少调料。」 * 具身大脑看美国?中国有机会做出好大脑吗? 中美数据成本差约 10 倍,低成本 + 多样性是中国的机会 关于派(Pi):证明了真实数据在夹爪上能泛化,验证了真实数据路线 现在远没到具身的「ChatGPT 3.5 时刻」:非结构化环境的通用还很漫长,但「专注一个 domain 」的通用是可以做出来的 灵初的双模型架构:R 是策略模型(输入图像/语言/本体状态,生成动作);W0 是世界模型(像真实世界仿真器,评估动作后的状态,用强化学习优化、放入约 30% 纠错失误数据),两个模型串成闭环,再回流生成新数据集 主流架构(Transformer)能不能成为绝对垄断架构,还需数据验证——Transformer 是在 GPT-3.5 之后吃掉巨量数据、加上强化学习才被验证的;具身底层架构的有效性,同样要靠足够的数据来验证 Part 6. 01:22:54 「游戏才刚刚开始,第一轮淘汰赛都还未开始。」 * 具身大脑公司,怎么做? 大模型&后训练人才:创业公司怎么和大厂抢人? 最难的事怎么解决?——「没有失败过的成功,是不可信的」 为什么拒绝把灵初定位为一家「AGI 公司」? 通用灵巧操作是技术通货:「未来我们甚至可以不做机器人」 AI 时代的产品经理有三个圈——懂技术、懂 UI(用户交互)、有商业思维 * 从 R(research),到 D(Development),到 P(Product)——如何在一个大组里快速迭代? 选场景必须同时满足两个条件:有真正商业价值的共性痛点(应用面广)、且符合数据泛化性需求 进工厂的事故责任:作为供应商有协议要负责,高节拍流水线很难,流水线下的供料等场景可跑通; 「具身这个行业早已被客户簇拥」 「曲线已开始跑但还没到真正拐点」「今年底是模型泛化性的第一个验证阶段」 基于数据量的模型迭代军备竞赛已开始,周期 3 年以上 「百万小时数据是我们最早提的,现在所有人都这么说时反而要警惕」 Part 7. 01:53:30 一个 70 后创业者的务实 & 浪漫 * 创业是冲浪还是西西弗斯:不存在"走到某阶段就彻底释放",过程本身才最重要 * 「某天清晨阳光斜照在 logo 墙上的一瞬间」 * 真正的中年危机:40 岁时,最怕未来与自己无关 * 「我最讨厌被叫老板」 * 我强烈推荐你去读摩根·豪泽尔的《Same as Ever》 * 创始人的基因(vision/mission/经历)真正决定了公司的路径 * DeepMind 哈萨比斯押注 AlphaGo 做出世界级成果,却 miss 了大语言模型;OpenAI 以"安全/非营利"起家,最后一批人出走创立 Anthropic——同一场 AI 史诗里有各种活法 加入听友群⬇️ 如果你是具身领域的专业 researcher ,欢迎添加主播微信(SJ_Jelyne).

124分钟
34k+
2个月前
74.与地瓜、阿里云的访谈:机器人爆发前夜,工程师成长,与 AI 的第三朵云

74.与地瓜、阿里云的访谈:机器人爆发前夜,工程师成长,与 AI 的第三朵云

卫诗婕|商业漫谈Jane's talk

回看历史,人类信息化的每一次范式转移,都有着相似的规律。移动互联网时代的真正到来,并不是因为第一代智能手机的组装下线,而是因为 iOS 和安卓生态的建立、云基础设施的普及,才让千千万万的独立开发者能够以极低的成本创造出改变世界的应用。 开发者成群涌现的前夜,往往是奇点到来的钟声。 今天的嘉宾,正是为这场范式革命加速的具身基建创业者。地瓜机器人的基础设施研发负责人秦玉森,以及阿里云无影事业部总经理张献涛博士。 秦玉森有着 20 多年的机器人开发经验,也是一名成熟的技术管理者 。在这一轮具身革命中,他与地瓜机器人,致力于打造机器人行业的母生态。 张献涛博士则亲历了移动互联网时代,云生态的建立。这期节目中,他清晰地讲述了,云计算,将如何成为撬动整个具身商业社会的超级杠杆。 这期内容不仅包含大量机器人的硬核技术,更是一部关于技术、人才以及基建变迁的微观商业史。 本期嘉宾: 秦玉森 - 地瓜机器人的基础设施研发负责人 张献涛 - 阿里云无影事业部总经理 本期 Shownotes: Part 1 . 03:06 机器人之梦 2000 年前后的机器人竞赛 九号收购赛格威机器人之后 北有九号,南有大疆 Part 2. 11:04 工程师的黄金年代 工程师的职业发展启示 & 工程师如何改变世界 技术管理挑战:《人月神话》 从工程师到架构师:认知从线性变立体 Part 3. 22:18 拐点已至:机器人爆发前夜 何为「战略节奏」:需求牵引出结构洞 自动驾驶与具身的人才大战:两个行业的前世今生 大模型降低工程师门槛,晶体智力 & 流体智力 实干家、具身三大派创业与各自的职责 机器人的美在于不完美 Part 4. 35:25 AI 时代的第三朵云:打造机器人的母生态 过去,机器人开发有多难:从重装电脑开始 中国STEM教育领先,小学生玩机器人很常见 什么是机器人的空气、土壤和水? 具身的「重复造轮子」:资源饱和溢出 为什么 Infra 人才特别稀缺? Part 5. 51:27 具身智能融资战 & 场景之战 资本泡沫可以让这个行业快速试错和试对 共识会极速形成 2025 每月的技术进步,快于过去的每一年 工程师培养,从 8 年压缩到3 年 年轻人脑子里的噪音更少,跑得更快 Part 6. 01:10:41 云的变迁 从云计算,到终端智能云计算 阿里云往事:All in 无线,关键一役 机器人时代的第三朵云,长什么样? Part 7. 01:24:02 AI 时代,云架构重构,Agent 与阿里的 TokenHub 什么是 Token 经济?阿里巴巴为什么要组建 Token Hub? 云上输出 token,独立开发者可推动浪潮 当 token 资源不再稀缺,大模型时代爆发期也将过去 Agent 加速机器人自进化,机器人在「做梦中」实现进化 养虾是养一群虾:必须是智能体群协作 Part 8. 前夜:开发者爆发、AI 原生代与利他生态 技术、终端和开发者工具的普惠体系 加入听友群⬇️

121分钟
16k+
2个月前
73.【520 特辑】AI +爱,赢了!|与黑客松冠军夫妇的随兴访谈

73.【520 特辑】AI +爱,赢了!|与黑客松冠军夫妇的随兴访谈

卫诗婕|商业漫谈Jane's talk

这是一期5·20特别节目,嘉宾是前不久举办的小红书黑客松大赛的硬件组冠军得主:一对用 AI Coding 和动手能力,实现了用意念控制轮椅的年轻夫妇。 2020年10月,肥牛在婚礼的答谢宴期间出现放射性剧痛,之后被确诊为脊髓占位,一种极其少见的脊髓肿瘤。在这之后,他经历了两次手术,并在第二次手术后出现瘫痪症状。 他说, 「人在一定程度的痛苦之下,那个痛苦是压制不住的;」「当时如果说给我一个按键,左边是生,右边是死,我已经按了很多次死的这个按键了」 经历了六年多的康复,肥牛通过坚持运动恢复了一定的行动能力,目前可以短距离行走,长时间仍需依赖轮椅。 从自身和脊髓受损人群的需求出发,他们与一群AI,合作实现了用脑机信号指挥轮椅前进的创意和demo。这个项目,成为黑客松大赛当晚,获得最多掌声的项目。 我在黑客松的第二天,与香菇肥牛夫妇录制了这一期播客。这是一个浓缩了太多生命力的故事:勇气、希望、爱情,以及 AI 时代最小单位能够实现的创新,还有,技术的温度。希望你喜欢~ 本期嘉宾: 肥牛(轮椅男主,脊髓损伤康复者,自媒体博主「肥牛在康复」&「肥牛卷不动」 香菇(元气女主,纯爱战神) 本期 Shownotes: Part 1. 噩耗,战神,与「种一棵树」 05:56「我们一起在种树,种的小树就是我们的情感,它慢慢发芽,其实它也是独立的」 06:55 按下「死的按键」——瘫痪后的玄学慰藉、第二代版本的人生 失能群体的标准路径:找医生 → 找玄学 → 容易被骗 社会基础设施的缺位——医学走到尽头时,玄学是必经站,骗子的密度也最高 两次手术:医生 30 年未见的罕见病 深夜高速路上的「遗言」:「看到她害怕,我也不敢说了」 「我们先学会了告别」 Part 2. 「缩短我与魔法之间的距离!」 21:49对标蔡磊先生的渐冻症管线开发:我想做「脊髓损伤管线开发」 脊髓损伤群体在中国约有三四百万,但医院康复科没有专门科室 产品匮乏:大小便恢复训练,用的是产后孕妈妈修复器械 "我无法原谅你们,我要永远拉黑你们" 无障碍科技往往由无障碍人士自己做:需求足够痛、对世界的改造欲和创造欲都更强 27:21 产品经理 + AI 调度师:一群 AI 在背后,我们就是千军万马 两个人+ 两台电脑 + 6 个 AI + 对应 agent:24 小时超预期实现 idea! 没参赛的备选项目:会唱歌的尿壶(背后也是一个感人故事) AI 时代的最小创新单位:创新门槛与成本的下降 真痛点产品的特征:「从经历中长出来」 31:55 善用 AI 等于管理 AI——把自己当公司,AI 当员工 不同 AI 的「AI 格」:Gemini 是"用爱训练出来的小孩"(脑电波被画成爱心形状),Claude 理智但极其傲娇(听不了一点坏话) 员工管理的四要素:了解特长、了解边界、合理分配、按贡献给待遇(充会员 vs 不充) Agent 像乐高:写代码、PPT 渲染、3D 模型修改各有分工,按工作流排序就能跑 「用得好 AI 的那一拨人,画像是创过业、当过老板、当过 leader——他们更善于拆解任务和分配」 在所有人都「用 AI」的时代,差距来自把自己定位为「AI 调度师」而非「使用者」 42:47 把判断权拿回手里——人的能力上限是 AI 的下限 核心原则:「你一旦发现 AI 不好用,那一定不是 AI 的问题,那是你的问题」 医生说没救就一定没救吗?自己去查案例、判断概率、问「我能不能成为那个少数派?」 学习的本质不是吸收知识,是创造「思辨能力」 AI 的天花板在用户:「它没有身体经历过一次尿失禁、一次瘫痪、一次绝望——这些是 AI 永远无法替代的」 AI 时代的稀缺资源不是技术深度,是「跨学科架构能力」 + 「判断权」 AI 只能复现人类已有的智力,不能复制人的第一手经验——用 AI 的天花板取决于你自己经历过、消化过、能拆解清楚的认知厚度 Part 3. 意念轮椅夺冠,马斯克式的天才创新! 49:34 脑机接口的真相——硬件不重要,数据解读体系才是 肥牛 2021 年瘫痪时就在论文里跟踪脑机研究——比马斯克植入第一个患者还早 柔性电极的类比:就是一块脑信号"硬盘"——大有大的好处、小有小的特点,本质是采集传感器 脑内 vs 脑外:脑内一手数据,脑外有屏蔽损耗,但没人能给出"脑外比脑内差多少"的精确百分比 "在学术体系里,他们都是在蒙的"——各家脑科学公司有自己的解读体系,1+1 在不同体系里可以等于 4 或 6 脑机的真正壁垒不是电极,是"谁先建成完整的语义系统" 学术体系想做的是"全语义解构"(把每个脑信号翻译成意念);产品工程师想做的是"在不解构的前提下让它有用"——两套完全不同的目标函数 57:29 天才级解法——抓两个数据包做差,绕开"翻译意念"的难题 不追求"精确翻译每一次意念",而是抓两个脑波数据包做差 A 数据包 - B 数据包 = 差异向量,把这个向量定义为指令 工程问题的马斯克式破局:与其翻译每个细节,不如重新定义"什么算可用"——从"科学家解构思维"切换到"产品工程师思维" 脑控的杀手级场景是"声控和动作识别都失效"的瞬间——情绪的微表情、看不见的兴奋、不便说话的环境——这些才是脑机接口的不可替代价值 Part 4. AI 、社区、创新浓度与长坡厚雪 01:08:46 小红书黑客松现场——王座轮椅、夏大哥、年轻 vs 年长、生命力… 现场加了 100+ 微信,几千公里赶来的选手"天才级想法"扎堆 获奖后展示:希望未来轮椅用户"都坐在王座上" 「隔壁的夏大哥(嵌入式开发资深选手)凌晨 3-4 点还在帮忙搭小车」 评价社区氛围的标准:"让人感受好的个体是不是足够多" 创新的浓度比技术深度更重要——把人放在足够浓度的氛围里,原本不期待的事就会发生 年长开发者的稀缺价值是「穿透型筛选」 + 利他主义——他们筛选合作者的维度更立体(思维架构、解构能力、人品),而不是「会不会写代码」 01:18:13 Built by Public + Build in Public——AI 时代创新的两个特征 黑客松把上下游全聚集——媒体 + 投资人 + 同行 + 选手,是一个 match 工厂 加完微信里有 20-30% 是投资人,剩下是技术顾问 + 媒体——"一般商业路演也不过如此" AI 时代创新范式的两个切换: - Built by Public——需求来自一个普适的、痛感强的小众群体 - Build in Public——Day 1 demo 做出来就直接面对公众,用户反馈成为产品迭代的一部分 公众既是需求源、也是验证者、合伙人、放大器 平台的真正价值不是工具或流量,是"创新浓度的密度场" 01:26:18 make things happen,happen 的速度比以往任何一个时代都要快 01:28:14 这棵小树——爱与生命力、此刻就是最幸福 (诗婕觉得:)外人觉得是香菇更勇敢,其实是肥牛 高大的人格才能种出这棵小树 18 岁感受不到青春:"我们当时就会觉得啊这个时间好快乐呀" 痛苦和快乐共存的能力是「经历过生死」的觉知 祝大家节日快乐,收获爱与勇敢~✨ 加入听友群⬇️

91分钟
11k+
3个月前
72.把宇树、ABB 等四家具身拉进小黑屋聊真心话:转型派 vs 新秀派,具身的现状、挑战与未来

72.把宇树、ABB 等四家具身拉进小黑屋聊真心话:转型派 vs 新秀派,具身的现状、挑战与未来

卫诗婕|商业漫谈Jane's talk

3月中,受到SAP思爱普的邀请,我在SAP全球运营峰会上主持了一场有关具身智能的圆桌论坛。 SAP是企业应用和商业AI方向的全球领导者,这家世界五百强公司的业务横跨190多个国家,在100多个地区拥有创新与研发中心,它的客户创造了全球84%的贸易。 这样一家巨型企业,在AI浪潮下,站得足够高,也成为了横向观察各行各业AI化转型的绝佳窗口。 简单来说,SAP深耕的数字化解决方案,与AI结合后,能够为企业打造一个业务感知型的AI底座——将数据、业务理解借由AI Agent 打通,成为AI落地企业所必备的商业大脑——而这样一个了解企业的大脑,还需要一个具身的本体,才能够真正将数字世界的智能,影响至物理世界,为制造业创造更多实际的价值。 因此,具身智能,就成为了这家数字化企业赋能全产业的绝佳切口。 这其中,一个相当重要的问题是,每个企业都渴望拥抱AI,但,是否每一家企业都具备了直接拥抱的条件? 答案就藏在这场众星云集的具身圆桌中。 本期播客由两部分组成:第一部分是我主持的圆桌实录;第二部分,则是我将四家具身企业单独留下,录制的闭门访谈部分,预告一下,非常精彩。 本期嘉宾: Robin郑锡亮 - ABB(全球机器人四大家族之一),中国区软件及数字化负责人。 Ryan 王琪 - 拓斯达(国产工业机器人翘楚) ,具身智能业务线矩阵智拓CMO Peter 谢一鹏 - 宇树工业场景解决方案负责人 William王浩然 - 星动纪元,亚太地区和中东负责人 徐勐 - SAP大中华地区客户咨询团队总经理 南立新 - 创业邦创始人&CEO 本期 Shownotes: Part 1.圆桌实录:企业拥抱 AI 转型,真的都准备好了吗? 08:12 机器人四大家族 ABB 的转型之路 11:11 工业翘楚拓斯达,全球化扩张背后 15:04 宇树与星动纪元:井喷的具身公司,差异化在哪? 20:05 SAP 给企业打造的 AI 接口与数字化底座,是什么? 22:39 企业级 AI 的需求:执行、开放、非绑定和安全 26:35 融资热到发烫:超520亿资金、超500起融资,但行业仍处于 POC 小批量验证阶段 29:04 刺激的快问快答:有关具身行业,最犀利的几个问题! Part 2. 闭门部分:把四家具身老板拉进小黑屋- 行业真正面对哪些真问题? 40:19 什么是好场景?怎样真正击穿? 43:03 宇树要做 toB 了?来讲讲工业地图…… 宇树 2025 交付 6000 +台人形机器人,今年目标 2 - 3万台 49:24 新秀想超车?激烈竞争下,切入场景、优先级怎么选? 54:40 训练的指数级成本提升 & 规模上量背后的真实挑战 58:57 具身必将洗牌,行业寒冬马上到来? 01:08:17 工业必定走在家庭场景前面? 01:13:28 从机器人 50 年史,看人形机器人发展:具身仍在百家争鸣 工业机器人发展50年,中国每万名工人配500台,进度约30 - 40%,人形机器人刚起步 01:24:31 拓斯达掏箱底式分享:人形机器人应用,蓝海在哪? 01:26:40 具身机器人的大规模爆发,还有多远? 01:28:07 家用人性机器人爆发时间点预测:赌一瓶茅台 😄 01:33:00 什么是 AI 时代的底层应用的现代化? 加入听友群⬇️:

95分钟
13k+
3个月前

加入我们的 Discord

与播客爱好者一起交流

立即加入

扫描微信二维码

添加微信好友,获取更多播客资讯

微信二维码

播放列表

自动播放下一个

播放列表还是空的

去找些喜欢的节目添加进来吧