Album

信号与噪声

绿洲资本 绿洲资本VB 音乐 · 音乐
1.76万 订阅 15 集 1个月前
播客简介
绿洲出品的播客栏目 以心印心,在AI时代参赞生命力
节目
E14.秦深涛:给人类造个新器官|北坡计划

E14.秦深涛:给人类造个新器官|北坡计划

信号与噪声

🎙️ 【本期简介】 把机器变得更像人,是过去几年具身智能最主流的方向。 还有另一条路:不是让机器学习人,而是让人与机器共同进化。当人的技能、经验与意图能够被理解、传递与强化,人机共融或许将进入另一种范式。 本期《信号与噪声》,我们邀请 OriginFlow 创始人、00 后清华博士创业者秦深涛,聊一种不同于脑机接口、动作捕捉和外骨骼的技术路径——从运动神经信号出发,让机器在动作发生之前,就理解人的意图,建立 Human to Robot Transfer 的第一代接口。 技术之外,我们也和他聊了聊创业、Calling 与生命力——为什么创业是一场 Life in Gaming,以及为什么有些问题,值得用全部生命去回答。 👤 【嘉宾介绍】 秦深涛:OriginFlow 创始人,本科就读于哈尔滨工业大学航空宇航制造工程系、博士就读于清华大学。2019 年起关注运动神经接口领域,2025 年正式创业。OriginFlow 专注于非侵入式肌电(sEMG)运动神经接口技术,通过外周产品构建人类全新"数字器官",采集运动神经信号并提前识别意图,搭建 Physical AGI 数据底层,最终重塑物理世界的交互基建。 🕒 【精选时间戳】 01:03 如果OpenAI成立那天互联网还没发明,我们该怎么办? 02:57 你想蒸馏的是这个世界,还是人本身? 05:07 什么是the golden data?当data被压缩到极致,它就变成了skill 08:06 两条路:把机器变成人,还是把人变成机器? 11:09 从Jobs到back to origin——器官的终点是回到人身上 15:09 那个人本身也可以不在。因为他在不断用的过程中,就被建模了 23:15 你们处理的就是钠离子变钙离子的那个瞬间的波 24:28 我比你早,所以我可以等到你,让我们同步发生 37:52 信号太微弱,又特别容易被干扰——19年之前没人觉得它值得工程化 43:06 十亿美金并购背后,交互的下一个变量藏在控制界面里 46:16 不要再玩匹配了,现在要去打排位 01:02:30 能否接受你最信任的队友在关键点位上的失误?逆风局的本质是心态 01:10:09 没有困难,创造困难也要上。困难是让你在短时间内成长的buff 01:17:12 生命力就是live in gaming,eventually become game changer 📚 【相关提及】 Physical AGI(物理人工智能 / 具身智能):指能够在真实物理世界中感知、行动、学习和完成任务的人工智能系统。它区别于只处理文本、图像或数字信息的 AI,更关注智能体与真实环境的交互。 Neural Interface(神经接口):连接人体神经系统与外部计算系统的技术路径,目标是让神经信号可以被读取、解释,并转化为设备控制或信息输入。 Brain-Computer Interface,BCI(脑机接口):直接采集和分析大脑信号,并将其转化为外部设备指令的系统。它常用于帮助运动障碍患者控制电脑、机械臂或其他辅助设备。 Neuralink:马斯克创办的脑机接口公司,采用侵入式路线,通过在脑内植入电极阵列读取神经信号。秦深涛认为侵入式是终极答案,但非侵入式的外周路线可以让"种子先一点点长大"。 MUAP(Motor Unit Action Potential):运动单元动作电位肌肉纤维收缩时产生的最小功能性电信号单元。OriginFlow通过腕部传感器捕捉这一信号来解码人的运动意图,信号出现在动作发生之前数十毫秒。 Neural Mismatch(神经错配):在脑机接口中,由于大脑860亿神经元密集排列,从头皮或皮层表面监测到的电信号难以精确定位来源。在外周神经(如手腕),这一问题相对可控,这也是 OriginFlow 选择从外周切入的原因之一。 CTRL-Labs:一家曾研究腕带式神经接口的公司,后被 Facebook / Meta 收购。它代表了用腕部信号理解人类运动意图的一条重要技术路线。 Meta Reality Labs:Meta 旗下负责 AR、VR 与下一代人机交互研究的部门。其公开研究中曾重点讨论基于腕部 EMG 的交互方式。 PULSE(Pre-training Universal Lightweight sEMG Encoder):OriginFlow 自研肌电信号编码模型,用于将原始肌电数据映射为可用于控制的意图表征。 Golden Data(黄金数据):本期节目中用来形容高质量、低噪声、可用于训练模型的关键数据。它不只是“更多数据”,而是更接近知识、技能和有效反馈的数据。 Golden Label(黄金标签):用于训练模型的高质量监督信号。相比普通标签,它更准确、更接近真实目标,因此能有效引导模型学习。 Latent Space(潜空间):机器学习中的抽象表征空间。模型会把复杂输入压缩到潜空间中,再从中学习结构、关系和特征。 Human-to-Robot Transfer(人到机器迁移):将人类在真实世界中形成的动作、技能、经验和判断迁移给机器人,使机器人能更接近人类的行为模式。 Human Augmentation(人类增强):通过技术扩展人的感知、控制、行动或认知能力。本期讨论中,它指向一个更远的未来:人通过新的“器官”提升与机器和世界交互的能力。 环太平洋(Pacific Rim):2013年科幻电影,人类驾驶巨型机甲与怪兽作战。秦深涛用它来想象未来的 Neural Interface形态——可能出现类似机甲服的全身肌电采集装备 🎵 【音乐】 Jordan Critz - Beau Et Rapide (Piano) 🎤 【创作团队】 主持|张津剑 出品|绿洲资本 剪辑制作|声度 Studio 播客工作室 💬 【互动时刻】 秦深涛用"打游戏"来理解创业:不打匹配打排位,追求逆风翻盘,甚至享受对手比自己强大。 在你的人生经验里,有没有一个"从匹配赛切换到排位赛"的时刻——你突然意识到这件事不能再当练习,必须认真了?那个切换是怎么发生的? 免责声明 本播客所述投资相关内容皆以交流分享为目的,仅供参考,不构成任何市场预测、判断,或投资、咨询建议。感谢您对本播客原创内容的青睐!如转载或引用本播客所述内容,请注明出处。转载前请与绿洲联系并取得同意。

77分钟
1k+
1个月前
E13.许华哲:刚起跑的具身,不等上市的人|北坡计划

E13.许华哲:刚起跑的具身,不等上市的人|北坡计划

信号与噪声

🎙️ 【本期简介】 北坡计划第二期,我们与破壳科技创始人、清华大学助理教授许华哲进行了一次深度对谈。 过去两年,具身智能几乎成为最炙手可热的行业方向之一,整个行业都在快速进入一种 “加速叙事” 里。但在许华哲看来,今天的大部分进展,距离真正意义上的通用,只是跑完了“第一公里”。很多问题甚至还没有被真正开始解决:大规模数据从哪里来、系统如何泛化、长期任务如何稳定执行、人类世界里的复杂物理交互怎样被真正理解。 某种意义上,具身智能并不是一场短跑式的技术爆发,而更像一场周期极长、需要持续迭代的马拉松。而比起“什么时候赢”,许华哲更在意自己想做的事情什么时候开始。 “做自己真正想做的事,才是最贵的特权。” 因为真正吸引他的,从来不是已经抵达的结果,而是那些尚未成形的新东西,是不断进入未知、不断突破边界的过程。 聊到音乐时,许华哲提到自己很喜欢贝多芬的《英雄》交响曲。那种仿佛提枪上阵、持续战斗的力量感,让人着迷。 某种程度上,他自己也是这样的人。 折腾不息,战斗不止。 👤 【嘉宾介绍】 许华哲:破壳科技创始人,清华大学交叉信息研究院助理教授、博士生导师,具身智能实验室负责人。 本科毕业于清华大学电子工程系,博士毕业于加州大学伯克利分校,博士后就读于斯坦福大学,长期从事具身智能、强化学习与机器人方向研究。23 年参与孵化具身智能公司星海图,被视为国内新一代具身智能研究者与创业者中的青年代表人物之一。 🕒 【精选时间戳】 03:43 “市场好坏不是本质,把机器人做出来才是使命” 06:31 具身智能像一场马拉松,但行业可能刚跑到第一公里 08:42 我们相信 scaling law,今天还没有真正“证明” scaling law 09:59 什么是真正的零样本泛化?“你发给我,我跑一下试试” 14:04 VLA “还不够优雅” 17:48 从 reactive 到 model-based:机器人为什么要预测未来 30:10 中国具身智能研究者真正缺少的,其实是“心气儿” 35:50 创业团队不应该为了“符合市场形状”而拼接 43:18 今天最强的 Researcher,真正想要的是做出 GPT 级别的东西 46:55 伯克利的学术氛围,所有人都可以直接说“This is wrong” 56:51 Lab 是放大个人形状,公司是放大组织形状 01:00:00 为什么更喜欢用“生命体”而不是“工具”描述人与组织 📚【相关提及】 * Figure 长时间直播:美国机器人公司 Figure 从 2026 年 5 月 13 日开始,用 F.03 机器人 + Helix-02 模型连续直播 191 小时(约 9 天),自主完成 23.8 万件包裹分拣;在测试片段,总计 318 个分拣的样本中,成功率约为99.7%。 * Generalist 的“一根线”:指 Generalist 每次发布时附上的"数据量 vs 模型性能"曲线。数据越多、机器人成功率越高的上扬上扬曲线,是目前机器人领域最接近 Scaling Law 的视觉证据。 * UMI(Universal Manipulation Interface):斯坦福 Shuran Song 团队 2024 年发布的开源机器人数据采集方案。人手戴上夹爪手柄 + 摄像头就能采集数据,不依赖昂贵的机器人本体。在保留毫米级末端精度的同时大幅降低了数据采集成本,是目前业内公认性价比最高的具身数据采集形态之一。 * 视觉 SLAM(Visual Simultaneous Localization and Mapping,视觉同步定位与建图):是一种仅靠摄像头就能让设备实时知道"我在哪、周围长什么样"的技术。系统通过分析连续视频帧之间的画面变化,一边推算自己的运动轨迹、一边重建周围环境的三维地图——是扫地机器人、AR 眼镜、自动驾驶等场景的底层能力之一。 * "动作头"(Action Head):机器人模型最后一层、专门负责"输出动作"的小网络模块。它接在一个已经训练好的视觉-语言大模型后面,把模型理解到的画面和指令翻译成机器人能执行的具体动作(如关节角度、夹爪开合)。 * WAM(World Action Model,世界动作模型):2026 年 5 月 arxiv 综述论文(arxiv 2605.12090)正式命名的范式,由 OpenMOSS 等团队提出,把"预测未来世界会怎么变"和"输出机器人动作"统一在同一个网络里完成。 * AMI(Advanced Machine Intelligence,高级机器智能):图灵奖得主、Meta 前首席 AI 科学家杨立昆(Yann LeCun)于 2026 年 3 月正式创办的 AI 公司,首轮种子融资 10.3 亿美元、估值 45 亿美元。 * JEPA(Joint-Embedding Predictive Architecture,联合嵌入预测架构):杨立昆(Yann LeCun)2022 年提出的世界模型架构。它不像主流大模型那样直接生成像素或文字,而是让 AI 在抽象隐空间中预测未来世界的变化——只学"会发生什么",不学"长什么样",被认为是更接近人类理解世界方式的路线。 * Diffusion Policy(扩散策略):哥伦比亚大学 Cheng Chi、Shuran Song 等人 2023 年提出的机器人动作生成方法:把扩散模型迁移到动作生成上,让机器人"从一团噪声里逐步去噪、生成一段流畅的动作序列"。配合 Action Chunk 使用,是当前模仿学习最主流的方法之一。 * Action Chunk(动作块):机器人模仿学习中的关键技巧,由斯坦福 Tony Zhao 等人 2023 年在 ACT 论文中提出:让模型一次性输出未来几十个动作的完整序列,从而大幅提升动作连贯性。是 Diffusion Policy 等主流方法的核心组件。 * 恰空(Chaconne):原是 16 世纪西班牙的三拍子舞曲,后演变为巴洛克最庄严的变奏曲式。许华哲提到的"恰空"特指巴赫《无伴奏小提琴第二组曲》BWV 1004 末乐章,约 14 分钟,是小提琴曲目里公认的精神最高峰之一。 * 《英雄交响曲》(Symphony No. 3 in E♭ major, "Eroica"):贝多芬 1803–1804 年创作的第三交响曲,被公认为古典主义向浪漫主义过渡的分水岭之作。贝多芬最初将其题献给拿破仑,听闻拿破仑称帝后愤而撕掉献词,改名"英雄"。全曲长约 50 分钟,规模、情感强度和结构复杂度都远超当时的交响曲传统,重新定义了交响曲这一体裁。 * D960 即舒伯特《降 B 大调钢琴奏鸣曲》: 1828 年逝世前两个月完成的最后一部钢琴奏鸣曲,约 40 分钟,弥漫着对死亡的平静凝视,被誉为"通往天国的音乐",是钢琴文献最伟大的作品之一。 * 《荒原狼》(Der Steppenwolf):诺贝尔文学奖得主赫曼·卡尔·黑塞 1927 年出版的长篇小说,与《悉达多》《德米安》并称黑塞代表作,讲述一个自认半人半狼、与中产阶级世界格格不入的知识分子的精神危机与觉醒,是 20 世纪关于孤独与异化的经典之作。 🎵 【音乐】 Jordan Critz - Beau Et Rapide (Piano) 《英雄交响曲》(Symphony No. 3 in E♭ major, "Eroica")第一乐章 🎤 【创作团队】 主持|张津剑 出品|绿洲资本 剪辑制作|绿洲资本 💬 【互动时刻】 小助理微信:VB20240606 你对自己的形状有没有感知?你有什么很好的方法,能让自己平静下来更好地倾听到自己的信号? 欢迎评论区留言,发布 7 日后点赞前 3 的小伙伴,我们准备了专属绿洲小礼物🎁 免责声明 本播客所述投资相关内容皆以交流分享为目的,仅供参考,不构成任何市场预测、判断,或投资、咨询建议。感谢您对原创内容的青睐!如转载或引用本播客所述内容,请注明出处。转载前请与绿洲联系并取得同意。

93分钟
3k+
2个月前
E12.高阳:会思考的芦苇,会行动的机器|北坡计划

E12.高阳:会思考的芦苇,会行动的机器|北坡计划

信号与噪声

🎙️ 【本期简介】 开年以来,千寻智能(SpiritAI)已接连完成两轮融资,总额近 30 亿。 具身智能正在快速成为资本与市场的共识。 当新的热点与叙事不断涌现,高阳的关注点却不在外部变化,而始终落在内部同一命题上:如果要实现具身智能的通用基础模型,下一步面临的问题会是什么?如何把问题真正解决? 北坡计划第一期,我们邀请了千寻智能联合创始人、清华大学助理教授高阳,围绕具身智能即将进入的“GPT-3 时刻”展开讨论。从数据、模型到系统能力,拆解这一判断背后的技术前提与未来展望;我们也把问题拉回个体,高阳是我们所有受邀嘉宾中,语速最慢的。他说:人不过是会思考的芦苇,不疾不徐,不试图成为某种“标准答案”,而是在外部价值选择与个体快乐之间不断回到自身,坚持内在节奏,展开属于自己的生命力。 👤 【嘉宾介绍】 高阳:千寻智能联合创始人兼首席科学家,清华大学交叉信息研究院助理教授。 本硕毕业于清华大学,博士毕业于加州大学伯克利分校(UC Berkeley)。他是全球具身智能与视觉-语言-动作模型(VLA)领域的顶尖青年学者。 🕒 【精选时间戳】 04:34 24 年初谈具身大模型,连学生都不信 07:15 ChatGPT 出来那一刻,他在伯克利的 AI 价值观被重塑了 08:37 既然大语言这条路走通了,具身智能为什么不行? 13:11 两年前预测要 5–8 年,现在的判断提前到了 27 年 17:52 一千万小时的数据,6000 个人,几个月。这件事中国有经验 29:42 评价一个具身模型,今天最重要的指标只有一个:泛化性 32:48 同门师兄弟 Sergey 和他,技术路径上的一致与分歧 39:26 未来的机器人是一个"多频谱"系统 48:36 如果有长生不老药,还会做一辈子机器人吗? 01:06:31 给科学家创业者:什么是信号,什么是噪声? 01:08:34 老子的"俭"不是节俭,是不耗散 01:11:32 ”价值还是快乐?我选择快乐“ 📚 【相关提及】(这次有点多,但都很有价值) 关于技术: * Scaling Law:缩放定律(OpenAI 于 2019 年提出)。指模型性能会随计算量和数据的增加而规律性提升,具身智能正在探索其在物理数据上的边界。 * VLA (Vision-Language-Action):视觉-语言-动作模型。一种端到端的具身智能架构,能让机器人“看懂”环境、“听懂”指令并直接输出物理动作。 * World Model:世界模型。能够理解并预测物理世界下一个状态的 AI 模型,未来有望在仿真环境中生成海量机器人训练数据。 * 遥操:远程操作(Teleoperation)。指人类通过设备远程控制机器人完成动作,当前市面上部分看似智能的机器人演示实则依赖此技术。 * Locomotion:运动控制。机器人的底层移动与平衡能力,控制频率极高,类似于生物的本能反射。 * Transformer:目前大模型通用的底层架构 。它像是一个高度灵敏的“注意力转换器”,能够捕捉数据序列中跨度极大的关联信息,是 ChatGPT 和具身智能大脑的共同基石 。 * 端到端 (End-to-End):一种“直达”的技术方案。指模型直接从原始输入(如摄像头画面)输出到最终结果(如机械臂动作),中间不经过人为设定的繁琐规则,让机器自己学习其中的映射规律。 * 泛化性 (Generalization):衡量具身智能含金量的核心指标。指 AI 在面对从没见过的环境或任务时,依然能表现出正确判断的能力,而不是只能机械地重复在实验室里练好的动作。 * Universal Function Approximator:通用函数拟合器。神经网络的基础数学理论,指拥有隐层的神经网络可以拟合世界上任何连续函数。 * CRISPR :基因编辑技术。节目中借此畅想未来人类可能通过修改基因大幅延长寿命的极端科幻场景。 * PR2 (PR two):一款经典的双臂科研机器人,是早期学者进行机器人抓取与控制实验的重要平台。 关于公司: * Generalist:全球具身智能前沿的初创公司,在真实物理世界的数据收集量上处于行业领先地位。4月2日最新发布的Demo,已宣称拥有 50w 小时数据。 * Physical Intelligence (PI):美国顶尖的具身智能初创公司,强调具身智能模型“通用性”。 * World Labs:由李飞飞创立的 AI 初创公司,正转型投入具身智能与“空间智能”的研发。 * AMI Labs:Yann LeCun 创办,致力于探索更具通用性的人工智能架构。 关于人: * Sergey Levine:加州大学伯克利分校教授、Physical Intelligence 联合创始人,被高阳形容为机器人领域的“活体维基百科”。 * Peter Thiel:彼得·蒂尔。硅谷著名投资人、PayPal联合创始人,也是著名的《从零到一》作者。 * Jitendra Malik:加州大学伯克利分校计算机视觉泰斗。他关于“动物为什么需要视觉”的进化论视角,启发了高阳转向机器人领域的研究。 * 吴翼:清华大学交叉信息研究院的杰出青年学者,蚂蚁集团强化学习实验室首席科学家,负责大模型强化学习方向研究。 * 许华哲:清华大学交叉信息研究院助理教授,高阳在伯克利实验室时期的学术同门。研究聚焦具身人工智能的理论、算法与应用,深度强化学习与机器人学等。 * 李飞飞:斯坦福大学教授,计算机视觉领域的先驱,ImageNet 发起者,World Labs 创始人。 * LeCun:杨立昆(Yann LeCun),深度学习三巨头之一,图灵奖得主。 关于理念: * 会思考的芦苇:源自法国哲学家帕斯卡尔的隐喻。指人类在肉体上像芦苇一样脆弱,但因为拥有独立的偏好与思考能力,从而具备了不可替代的特殊价值。 * 老子的“三宝”:出自《道德经》的“一曰慈,二曰俭,三曰不敢为天下先”。节目中特指“俭”,意为不耗散自己的心力与欲望。 🎵 【音乐】 Jordan Critz - Beau Et Rapide (Piano) 🎤 【创作团队】 主持|张津剑 出品|绿洲资本 剪辑制作|声度 Studio 播客工作室 💬 【互动时刻】 小助理微信:VB20240606 如果在你面前有两个选择:一件是世俗意义上具有巨大“价值”但让你痛苦的事,另一件是让你发自内心“快乐”但看似无用的事,你会怎么选?欢迎留言评论! 我们将为评论区最高点赞的 3 位听友,赠送高阳播客结尾所说的绿洲小书一本。 免责声明 本播客所述投资相关内容皆以交流分享为目的,仅供参考,不构成任何市场预测、判断,或投资、咨询建议。感谢您对原创内容的青睐!如转载或引用本播客所述内容,请注明出处。转载前请与绿洲联系并取得同意。

88分钟
7k+
4个月前
评价

空空如也

加入我们的 Discord

与播客爱好者一起交流

立即加入

扫描微信二维码

添加微信好友,获取更多播客资讯

微信二维码

播放列表

自动播放下一个

播放列表还是空的

去找些喜欢的节目添加进来吧