主播
节目简介
来源:小宇宙
如今的模型在数字世界里游刃有余。它能写诗、会画画、认得清图片里的猫。但一旦把同样的模型放到机器人身上,问题就暴露了:它看得见玻璃后的猫,却不知道那道玻璃过不去;它知道水杯要倒,但推理太慢,等反应过来水早已洒了。
数字世界的“懂”,不等于物理世界的“会”。
过去一周,蚂蚁灵波科技密集发布并开源了6 款模型,涵盖空间感知、世界模拟、动作执行等完整技术链条。
社交媒体刷屏、开发者社区强烈关注、多次登上海内外平台Trending趋势,开源的4款模型在GitHub上总Star数已超过2.3K……
不止模型本身,LingBot2.0更提出了一个明确的技术主张:具身原生。机器人的大脑,不该是通用大模型的“移植版”,而应该从零开始,为物理世界量身定做。
什么是“具身原生”?为什么机器人不能只是大模型在物理世界里的一个 Agent?为什么数字世界里好用的视频生成、多模态模型,到了机器人身上就会遇到新问题?
这期节目,我们与灵波科技首席科学家沈宇军从灵波大脑 2.0 的发布聊起,一起聊聊灵波如何为机器人装上一颗“原生大脑”。
🧑🤝🧑本期嘉宾
沈宇军:蚂蚁灵波科技首席科学家
👩本期主播
石洪竺:魔搭社区运营负责人
📒时间轴
一、灵波大脑 2.0:为什么要提出“具身原生”
03:13 从灵波 1.0 到 2.0:半年时间里,模型能力做了哪些升级
04:33 从模型架构、数据到算法,天然为机器人设计
05:18 灵波正式提出“具身原生”,是为了解决机器人的三个问题:“看得更清楚”、“想得更明白”、“干得更利索”
二、看得更清楚:机器人不能只识别,还要理解物理距离
08:46 数字世界追求清晰度、画质和创造力,物理世界更在乎时效性和合理性
10:21 为什么要做一个尽可能通用的机器人“大脑”
12:52 大模型吃了几十年互联网数据红利,但具身场景的很多数据工作都要从零开始
15:18 “开门见猫”:当门关闭时,深度图就无法识别门后的猫,仅靠语义识别无法理解三维空间
(“开门见猫”)
17:20 灵波的视觉训练聚焦几何边缘检测,通过识别轮廓和边界,让机器人能感知物体位置和障碍物
(几何边缘检测)
20:29 Depth 2.0 的升级:更换预训练方式,扩大数据量,解决更多 corner case
三、想得更明白:机器人需要单向、快速、可交互的世界模型
22:17 现实世界不是全可控的,机器人的思考要像时间一样单向流动
23:52 World 2.0:支持更长时间(小时级别)的视频生成和交互
26:07 机器人执行任务时,必须能应对被打断、被干扰的情况
28:14 Dense 架构推理效率不够,为什么要做 MoE 视频生成模型
32:09 一个无法摆拍的 demo:机器人如何实时响应人的随机动作
(机器人打球)
34:45 物理世界不需要视频生成得多漂亮,而需要生成得足够快、足够合理
(LingBot-World-Infinity)
四、干得更利索:真正落地后,才知道数据缺在哪里
36:30 “具身原生”讲起来是态度,做起来是能力
40:19 真实场景里,机器人需要抬手、弯腰、移动底盘,不只是动双臂
41:19 灵巧手、头部、腰部、底盘等自由度,都需要新的数据覆盖
41:59 从 9 种构型升级到 17 种构型,扩展可控自由度
42:29 数据规模化不只是堆量,更要关注任务、构型、自由度的分布
45:10 数据闭环不是采集完就结束,而是训练反馈到采集端
五、具身智能的下一步:灵巧手、传感器和数据
46:43 从 1.0 到 2.0,具身智能下一阶段的拐点是什么
48:24 未来三个关键变化:灵巧手、传感器、多模态数据
50:43 具身智能的 ChatGPT 时刻:当每个人都能参与训练机器人
51:48 终局想象:机器人进入家庭,承担重复、危险、精细的任务
53:50 对开源社区的期许:建立公允、共同认可的中立Benchmark
📖名词解释
* 具身智能:让智能体拥有身体,并能在真实物理环境中感知、决策和行动的 AI 方向。
* 具身原生:从模型架构、训练数据、算法和任务目标开始,就面向机器人和物理世界设计,而不是直接套用数字世界模型。
* 世界模型:让 AI 在内部模拟环境变化和未来结果的模型。对机器人来说,它可以帮助提前预演动作后果。
* MoE:Mixture of Experts,混合专家模型。通过只激活部分专家模块,在保持模型容量的同时提升推理效率。
* Benchmark:评测基准,用来衡量模型能力。具身智能目前仍需要更公允、更贴近真实物理任务的评测标准。
🔗延伸阅读
灵波科技官网:https://www.robbyant.com/product/R2
直播回放链接:https://weixin.qq.com/sph/AZKXWkFrqs
策划:常常
运营:千寻
更多节目信息,欢迎关注小红书:会友播客
添加小助手微信:huiyouhz,可以加入听友群喔
数字世界的“懂”,不等于物理世界的“会”。
过去一周,蚂蚁灵波科技密集发布并开源了6 款模型,涵盖空间感知、世界模拟、动作执行等完整技术链条。
社交媒体刷屏、开发者社区强烈关注、多次登上海内外平台Trending趋势,开源的4款模型在GitHub上总Star数已超过2.3K……
不止模型本身,LingBot2.0更提出了一个明确的技术主张:具身原生。机器人的大脑,不该是通用大模型的“移植版”,而应该从零开始,为物理世界量身定做。
什么是“具身原生”?为什么机器人不能只是大模型在物理世界里的一个 Agent?为什么数字世界里好用的视频生成、多模态模型,到了机器人身上就会遇到新问题?
这期节目,我们与灵波科技首席科学家沈宇军从灵波大脑 2.0 的发布聊起,一起聊聊灵波如何为机器人装上一颗“原生大脑”。
🧑🤝🧑本期嘉宾
沈宇军:蚂蚁灵波科技首席科学家
👩本期主播
石洪竺:魔搭社区运营负责人
📒时间轴
一、灵波大脑 2.0:为什么要提出“具身原生”
03:13 从灵波 1.0 到 2.0:半年时间里,模型能力做了哪些升级
04:33 从模型架构、数据到算法,天然为机器人设计
05:18 灵波正式提出“具身原生”,是为了解决机器人的三个问题:“看得更清楚”、“想得更明白”、“干得更利索”
二、看得更清楚:机器人不能只识别,还要理解物理距离
08:46 数字世界追求清晰度、画质和创造力,物理世界更在乎时效性和合理性
10:21 为什么要做一个尽可能通用的机器人“大脑”
12:52 大模型吃了几十年互联网数据红利,但具身场景的很多数据工作都要从零开始
15:18 “开门见猫”:当门关闭时,深度图就无法识别门后的猫,仅靠语义识别无法理解三维空间
(“开门见猫”)
17:20 灵波的视觉训练聚焦几何边缘检测,通过识别轮廓和边界,让机器人能感知物体位置和障碍物
(几何边缘检测)
20:29 Depth 2.0 的升级:更换预训练方式,扩大数据量,解决更多 corner case
三、想得更明白:机器人需要单向、快速、可交互的世界模型
22:17 现实世界不是全可控的,机器人的思考要像时间一样单向流动
23:52 World 2.0:支持更长时间(小时级别)的视频生成和交互
26:07 机器人执行任务时,必须能应对被打断、被干扰的情况
28:14 Dense 架构推理效率不够,为什么要做 MoE 视频生成模型
32:09 一个无法摆拍的 demo:机器人如何实时响应人的随机动作
(机器人打球)
34:45 物理世界不需要视频生成得多漂亮,而需要生成得足够快、足够合理
(LingBot-World-Infinity)
四、干得更利索:真正落地后,才知道数据缺在哪里
36:30 “具身原生”讲起来是态度,做起来是能力
40:19 真实场景里,机器人需要抬手、弯腰、移动底盘,不只是动双臂
41:19 灵巧手、头部、腰部、底盘等自由度,都需要新的数据覆盖
41:59 从 9 种构型升级到 17 种构型,扩展可控自由度
42:29 数据规模化不只是堆量,更要关注任务、构型、自由度的分布
45:10 数据闭环不是采集完就结束,而是训练反馈到采集端
五、具身智能的下一步:灵巧手、传感器和数据
46:43 从 1.0 到 2.0,具身智能下一阶段的拐点是什么
48:24 未来三个关键变化:灵巧手、传感器、多模态数据
50:43 具身智能的 ChatGPT 时刻:当每个人都能参与训练机器人
51:48 终局想象:机器人进入家庭,承担重复、危险、精细的任务
53:50 对开源社区的期许:建立公允、共同认可的中立Benchmark
📖名词解释
* 具身智能:让智能体拥有身体,并能在真实物理环境中感知、决策和行动的 AI 方向。
* 具身原生:从模型架构、训练数据、算法和任务目标开始,就面向机器人和物理世界设计,而不是直接套用数字世界模型。
* 世界模型:让 AI 在内部模拟环境变化和未来结果的模型。对机器人来说,它可以帮助提前预演动作后果。
* MoE:Mixture of Experts,混合专家模型。通过只激活部分专家模块,在保持模型容量的同时提升推理效率。
* Benchmark:评测基准,用来衡量模型能力。具身智能目前仍需要更公允、更贴近真实物理任务的评测标准。
🔗延伸阅读
灵波科技官网:https://www.robbyant.com/product/R2
直播回放链接:https://weixin.qq.com/sph/AZKXWkFrqs
策划:常常
运营:千寻
更多节目信息,欢迎关注小红书:会友播客
添加小助手微信:huiyouhz,可以加入听友群喔