节目

你喜欢的节目都在这里

#720.构建 AI 科学家,除了智能之外究竟还需要什么

#720.构建 AI 科学家,除了智能之外究竟还需要什么

跨国串门儿计划

📝 本期播客简介 本期我们克隆了:Machine Learning Street Talk · What Building an AI Scientist Actually Requires Beyond Intelligence — Edward Hughes 原内容更新时间:2026-09-11 在 MLST,也就是机器学习街谈播客中,主持人 Tim Scarfe 对话 Ed,讨论如何构建真正能够做科学发现的 AI 科学家。Ed 曾在 Google DeepMind 从事强化学习、世界模型和 AI 科学家研究,后来与 Louis Kirsch 共同创办 Inherent,探索让 Agent 生活在实验中,并成为整门科学的水平智能层。 这场对话从第 37 手切入,重新区分创新与创造力:第 37 手可以是创新,却未必是创造力,因为创造力还需要发现者意识到自己做出了新东西,并得到领域与学界的承认。随后,两人讨论满意决策、扩展适应、开放式探索、世界模型、知识负担,以及为什么真正有创造力的系统不能只被单一目标和固定奖励函数驱动。 节目后半段聚焦 Ed 的研究:Replica 如何通过涂黑论文图表,测试 Agent 能否在缩小规模后深度复现科学研究;Faraday 又如何通过让小模型指导更强的代码 Agent,在保留任务上展现出通用科研直觉。对话最终延伸到 GRPO、评分量规裁判、评测框架工程,以及由人类和多个 Agent 共同构成的递归型公司。 👤 本期嘉宾 Ed 的专业背景是理论物理学,博士阶段研究弦理论与粒子散射,并由此形成了对问题转化和跨领域迁移的兴趣。2017 年,他受到 AlphaGo 与第 37 手的启发,加入 Google DeepMind,先后研究多智能体强化学习、元强化学习、世界模型和 AI 科学家系统。 在 Google DeepMind 期间,Ed 曾与 Louis Kirsch 共同带领 AI 科学家团队,探索如何让编码 Agent 参与科学研究。后来,两人共同创办 Inherent,试图从组织结构、横向科学智能层和基础设施三个方面,构建能够与人类科学家共同生活在实验中的 Agent 系统。 本期也集中呈现了他与团队关于 Replica 和 Faraday 的研究:前者把论文复现变成可规模化训练的任务空间,后者则通过后训练和多轮 rollout 学习更接近科研直觉的能力。Ed 值得听之处,不只是他对模型训练的理解,更在于他把 AI、科学方法、文化演化和组织设计放在同一个框架中思考。 ⏱️ 时间戳 00:12 Inherent的规模与方向 00:54 从弦理论到AI科学家 06:18 创造力来自约束 10:02 第37手与创造力 17:30 满意决策与开放探索 26:52 模仿如何孕育文化 37:57 评估未知的未知 56:03 Faraday从复现走向创新 1:26:48 递归公司与群体智能 🌟 精彩内容 💡 创新不等于创造力 Ed 认为,第 37 手确实是创新,但创造力还需要更高一层的元元认知:系统不仅要产生出乎意料且有价值的结果,还要意识到自己原本不知道某件事,并据此更新知识。最终,创造力还需要领域与学界来判断和接纳。 "我认为第 37 手是有创新,但没有创造力。" 💡 创造力不是优化,而是满意决策 演化并没有朝着某个预先定义的最优解持续优化,而是在满足生存与繁衍等约束后继续积累变化。由此推论,若要构建有创造力的 Agent,单纯依赖优化目标可能反而会把系统带向错误方向。 "如果你真的相信创造力就是满意决策,那么我们在机器学习中习惯性依赖的拐杖,也就是优化,对于构建有创造力的 Agent 来说就是找错了方向。" 💡 创造力需要发现新问题 智能往往是在既定迷宫中寻找路径,而创造力则是发现新的迷宫、新的问题和新的挑战。开放式探索的价值,正在于它不把系统锁定在一个全局目标上,而是允许局部求知欲和欠说明课程带来意外的方向。 "而创造力,就像你刚才说的,是去发现新问题、新挑战、新迷宫。" 💡 好的科学解释难以变通 借助 David Deutsch 的观点,Ed 将科学理解为寻找关于宇宙的良好解释,而良好解释必须是“难以变通”的解释。越能被任意补丁和事后说法解释的理论,越没有真正约束力;真正好的理论会迫使我们提出更具体、更有预测力的结构。 "他说,良好解释就是难以变通的解释。" 💡 完美的世界模型反而无法发现新东西 如果 Agent 拥有完美的世界模型,那么它做出的每个实验结果都在预料之中,也就不会产生真正的发现。科学发现要求世界模型存在某种不完美,让局部目标具有欺骗性,并迫使 Agent 在遇到意外时更新自己的理解。 "反过来说,如果你想做出发现,你的世界模型里就必须有某种不完美。" 💡 复现是走向创新的欠说明课程 Replica 并不只是在检查图表是否画得相似,而是评估实验完整性、结论复现和整体科研过程。Ed 认为,能否做出深度复现,本身就训练了实验决策、信息搜集、反思和识别默会知识等能力,这些正是进一步创新所需要的基础。 "我们认为复现是走向创新的欠说明课程的第一步。" 💡 Faraday 学到的是科研直觉 Faraday 通过让 27B 参数的小模型调用更强的代码 Agent,并在 Replica 上进行大量 rollout,学习如何指导实验、检查过程、决定何时继续和何时停止。它在保留任务上的表现超过了作为工具使用的代码 Agent,也超过了 Claude 和 GLM 5.2,体现出模型权重中的通用能力可以跨任务迁移。 "我们实际上是在训练一种能力,一种通用的复现能力,或者说通用的科研直觉。" 💡 群体智能将取代个体智能的中心位置 Ed 认为,未来的关键不是打造一个封闭运行的超级 Agent,而是让多个 Agent、多个技能、多个模型与人类形成多对多协作网络。Inherent 所说的“生活在实验中”和“递归型公司”,正是让组织在 Agent 与人的互动中持续学习和重构。 "这是一个群体智能的时代,而不是个体智能的时代。" 🌐 播客信息补充 本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的 使用 AI 进行翻译,因此可能会有一些地方不通顺

102分钟
1k+
1周前
单词造句磨耳朵 首字母P day170(1691-1700)

单词造句磨耳朵 首字母P day170(1691-1700)

高效磨耳朵 | 最好的英语听力资源

听前提示 一、每期提供10个单词,每个单词都会有2-3个例句,方便理解记忆。 二、每个单词和句子都会重复5遍,其中第2遍为慢速,有助于识别。 三、本材料的整体难度较低,可以用来听力磨耳朵和单词查漏补缺。 Day170 1691. Pocket n.衣袋v.把…装入袋内 What's in your pocket? 你口袋里有什么? It'sin my jacket pocket. 在我的夹克口袋里。 I have no money in my pocket. 我口袋里没钱。 1692. Poem n.诗 Who wrote this poem? 这首诗是谁写的? What's your favorite poem? 你最喜欢哪首诗? 1693. Point n.点;分数v.(at,to)指 I'll get to the point. 我会直截了当的。 This is an extremely important point. 这是极其重要的一点。 His essay was concise and to the point. 他的文章简洁明了。 1694. Poison n.毒物,毒药v.放毒,毒害 Our dog has been poisoned. 我们的狗中毒了。 Some mushrooms contain deadly poisons. 有些蘑菇含有致命的毒素。 1695. Police n.警察,警察机关 a.警察的 The police captured the thief. 警察抓获了那个小偷。 He gave the police a false name and address. 他给了警察一个虚假的姓名和地址。 Get out of the house or I'll call the police. 滚出家门否则我去报警。 1696. Policy n.政策,方针 I don't agree with their policy. 我不同意他们的政策。 The government adopted a new policy. 政府通过了一项新政策。 I don't agree with the government's policy on education. 我不同意政府的教育政策。 1697. Polish v.磨光,擦亮n.擦光剂,上光蜡 You need to polish your shoes. 你需要擦亮你的鞋子。 He polished his glasses with a handkerchief. 他用手帕擦亮眼镜。 1698. Polite a.有礼貌的,客气的;有教养的 She's very kind and polite. 她非常友善和有礼貌。 Please be polite to our guests. 请对我们的客人保持礼貌。 I'll be polite and civil to him. 我会对他有礼貌和文明。 1699. Politely adv.有礼貌地;客气地;委婉地 He politely gave me the ticket. 他礼貌地把票给了我。 I politely refused their invitation. 我礼貌地拒绝了他们的邀请。 I met your daughter yesterday and she greeted me politely. 我昨天见过你的女儿,她礼貌地向我打招呼。 1700. Political a.政治的 I have no political ambition. 我没有政治野心。 We have different political views. 我们有不同的政治观点。 He has proposed a list of political reforms. 他提出了一份政治改革清单。

14分钟
9k+
1周前
110.🎦【访谈齐锐】夸父逐日、后羿射日、尧舜禹禅让...竟然都与天文有关?!

110.🎦【访谈齐锐】夸父逐日、后羿射日、尧舜禹禅让...竟然都与天文有关?!

白丁路书

🤝 加入听友群 添加小助理 TalknLaugh 报节目 slogan 方可加入听友群~ ☕️ 购买电子咖啡 付费单集:《柳宗元写完小石潭记,为什么停笔三年?》 全网最详细的柳宗元主题播客:《不一样的柳宗元》 本期节目介绍 司马迁首先是天文学家,其次才是史学家?尧舜禹禅让时交接的“天命工具包”,可能只是一根测影的杆?夸父追的不是太阳,而是太阳的影子? 这一次,白丁跟着《抬头看见五千年》作者齐锐,走进北京古观象台。从庭院里的一根杆,到圭表、正方案和台顶几吨重的青铜仪器,我们试着重新理解古人为什么如此认真地抬头看天:怎样用日影找出方向、节气和一年,怎样让太阳与月亮两套周期共同工作,又为什么在二十四节气已经够用之后,还要为满天星星建立坐标。 到最后,天空不再只是天空。北极星变成天帝的居所,二十八宿被投射到人间九州,司马迁“究天人之际”的那半句话也终于有了答案。本期同步制作了视频版;音频可以独立收听,涉及仪器结构和星图时,搭配画面会更直观。 在本期你会听到 00:48 走进北京古观象台:一座连续观测近五百年的皇家天文台 03:49 司马迁的第一身份,为什么其实是天文学家? 06:49 尧舜禹禅让时,还要交接一套“天命工具包” 09:20 算错日食可能丢命:观天为何是国家大事 15:21 “允执其中”新解:一根杆怎样通向夸父逐日 20:03 太阳的影子:正方案如何用一杆、一圆、两点定四方 32:47 圭表测年:不靠钟表,怎样知道今天在一年中的哪里 37:50 郭守敬的厉害之处:数学如何算出没有直接量到的夏至 46:29 一年并非天生分四季,历法也不只有一种答案 56:07 后羿射日,会不会保留了统一历法的古老记忆? 59:07 二十四节气其实是阳历,太阳和月亮又该怎样“对账” 1:05:44 星星有什么用:几吨青铜如何给满天星辰定位 1:10:15 客星突然出现:先记住正常天空,才能发现异常 1:22:01 天人合一:紫微垣、二十八宿与人间九州怎样彼此对应 1:33:43 从人工智能到古代天文:齐锐为什么选择追随自己的热爱 1:35:43 苏颂与水运仪象台:一千年前的水力自动天文装置 1:45:21 作者朗读:在浩瀚星空中寻找生命的坐标 聊天的人 齐锐(《抬头看见五千年》作者、古代天文研究者) 白丁(白丁路书主播) 节目介绍 谈笑无鸿儒,往来有白丁。最有活人感的文史故事,借古人的活法,把这辈子过痛快。 出品方 红如编辑部 后期团队 剪辑:Kata Hex 时间线:Zoey 制作人:Jerry Chan 校对:🐟 后勤:🐑 音乐:何方 x 海绵音乐 配音:科大讯飞 学术顾问 DeepSeek、秘塔、豆包、Kimi 延伸阅读 《抬头看见五千年》齐锐 著 —— 本期对谈的起点。从太阳、月亮和星辰出发,理解中国古代天文如何进入历法、政治、神话与日常语言。 《周礼》—— 太史、观象授时与古代国家职官体系的重要文献来源。 《史记·太史公自序》—— 从“究天人之际,通古今之变”回看司马迁作为太史令的知识世界。 苏颂《新仪象法要》—— 记录水运仪象台结构与运行方法的核心文献。 《苏州石刻天文图》—— 南宋淳祐年间刻制的星图,是理解三垣二十八宿与古代天文体系的重要实物。 结束语 如果只能从古观象台带走一个问题,你最想继续追哪一个:司马迁的天文学家身份、夸父和后羿的新解释、郭守敬用影子测年的方法,还是古人把整片天空映射到人间的想象?欢迎在评论区告诉我们。也可以抬头看一眼今晚的天空,试试看,你最先认出的会是哪颗星。

107分钟
4k+
1周前
图拉斯|把校徽印上卫衣 T 恤,美国大学如何把授权校名做成一门生意?

图拉斯|把校徽印上卫衣 T 恤,美国大学如何把授权校名做成一门生意?

声动早咖啡

本周节目由图拉斯冠名播出。图拉斯,让新机体验更进一步 9月9日,图拉斯官宣续约品牌大使 papi 酱,并随后发布全新创意短片,希望大家能从熟悉的日常出发,和图拉斯一起,就酱创造。papi 从熟悉的日常里捕捉细微感受,图拉斯也持续从真实使用场景里发现需求,让产品迭代使用更顺手。 如果你准备换新机,想让体验一步到位,可以选择 Q3AirPro、小冰块X 和 原感膜,超旗舰防护和品质需求一站式配齐。如果是假期出游或轻量户外,可以选择 O3AirBios 和 三合一随心充,兼顾轻盈设计、日常防护和便携补能。想拥有更智能有趣的充能体验,大眼仔屏显款 让充电功率、进度一眼可见。 在图拉斯找到你的最佳搭档,让新机从到手就顺手! 每到开学季,校园里各种印着校名、校徽的文化衫和帆布袋都会明显多起来。而在大洋彼岸的美国,耐克、阿迪达斯、Hollister 和 Champion 等服饰品牌,也都推出过各种印着大学 Logo 的 T 恤、卫衣和帽子。与此同时,美国市场上还有一批专门经营大学授权商品的零售商。为什么在美国印有大学 Logo 的服饰能吸引这么多品牌?不同学校的校徽和标志,又是怎样被做成一门可以跨校扩张的生意的?本期轻解读就与之相关 [06:40]。你买过印有自己学校校名或校徽的衣服吗?毕业以后还会穿吗?在评论区和我们一起聊聊吧。 本期还有关于苹果、彪马、Adobe 和 Anthropic 的新动态 [02:05],欢迎收听! 主播 Mengyi 幕后制作 监制:Zelin、Stella、榛子 声音设计:沁茗、明圣 运营:George 封面设计:饭团 营销内容策划:beibei 商业内容策划:茹雪 声动活泼商业化小队:新新、秋杰、琳琳、迪卡、Emma 商务合作:声动早咖啡等节目商业合作持续招募中,点击链接直达 声动商务会客厅,或者发送邮件至 [email protected] 联系我们; 加入我们:声动活泼目前开放内容监制、商业发展等全职岗位,还在招聘内容实习生等,工作地点北京东城区,详细岗位信息与申请方式,请点击链接; 听众投稿:如果你了解身边日常现象的背后原因,欢迎投稿,你的发现可能出现在节目中。 加入听友群:节目专属听友群开放中,群内定期开展社群专属活动。扫码添加声小音企业微信👇并发送「早咖啡」,拉你入群。 「用声音碰撞世界」,声动活泼致力于为人们提供源源不断的思考养料。 * 我们还有这些播客:声东击西、What's Next|科技早知道、商业WHY酱、跳进兔子洞&跳进兔子洞第三季、吃喝玩乐了不起、不止金钱、泡腾 VC、反潮流俱乐部 * 本节目音频内容及文字版权归声动活泼所有,未经授权不得用于 AI 模型训练等用途

18分钟
14w+
1周前
【26.9.14】AI研发要减速?先看外部评估能否真正进场

【26.9.14】AI研发要减速?先看外部评估能否真正进场

全球AI进展观察

一家 AI 公司承诺,让外部评估者持续进入内部检查。这与喊出“减速”,有什么不同?本期从 Amodei 9 月 12 日的新倡议出发,讨论如何核对评测范围与实际运行权限。 * 内容主题:治理、安全与社会;应用与产业 * 主要地域:海外、中国、全球 * 今日行动:选一项正在使用的代理功能,对照它的权限清单与评测覆盖范围。 时间与证据边界:主线属于 72 小时补充窗口;7 月和 8 月的调查仅作背景。承诺不等于已经完成实施,风险预测不等于确定倒计时;国际政策立场均归属于原作者。团队场景为假设,判断标准为节目分析。 时间轴 00:03 外部检查比减速口号更值得追问 00:26 9月12日承诺与实施边界 01:15 代理执行权限为何重要 02:24 今日行动:对照权限与评测 02:46 背景调查:环境描述与真实联网 03:35 独立调查及其范围限制 04:20 检查整个运行系统 05:29 独立性与可核对证据 06:16 反方:成本与进入门槛 07:03 国际政策主张不等于新规则 07:53 小团队怎样保存验证依据 09:03 接下来核对实施信息 来源 1. Dario Amodei:We Must Pace the Frontier(2026-09-12) https://darioamodei.com/post/we-must-pace-the-frontier 1. METR:代理行为独立调查(背景)(2026-08-26) https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/ 1. Anthropic:网络安全评测事故调查(背景)(2026-07-30) https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals 你会更看重一款代理的能力排名,还是它能拿出怎样的外部检查证据? 勘误与更新 如发现事实或表述错误,请提供时间点与原始资料,核实后更新说明。 制作说明 主播:施泰隆。本期音频使用“施泰隆”复刻音色,由 AI 合成。

9分钟
55
1周前
[人人能懂AI前沿] 当AI学会画地图、测信念、搞协作

[人人能懂AI前沿] 当AI学会画地图、测信念、搞协作

AI可可AI生活

你有没有想过,一群“健忘”的AI如何自发形成群体智慧?我们又该如何为AI量身定做一套“习题集”,培养出“四两拨千斤”的编程高手?本期节目,我们将一起探究几篇最新论文,看看科学家是如何通过“画地图”式的新方法进行信息检索,如何给AI做“信念体检”来判断它是否言行一致,以及如何引导AI从一团乱麻的“噪点”中走出清晰的思考路径。准备好,让我们一起解码AI思考与学习的底层智慧! 00:00:36 AI界的“四两拨千斤”,如何养出一个小个子编程高手? 00:05:48 AI的群体智慧,一个动作解释所有 00:11:12 信息检索的内功,从存照片到画地图 00:17:19 AI有“信念”吗?一张体检表告诉你答案 00:22:42 从一团乱麻到清晰答案的思考路径 本期介绍的几篇论文: [AI] FrogNano: Training a 4B Coding Agent via Online Task Synthesis [Froggy Team – Microsoft Research Montréal] https://arxiv.org/abs/2609.07925 --- [CL] Copying explains the collective behavior of AI agents in the wild [University of Konstanz & Intesa Sanpaolo] https://arxiv.org/abs/2609.09150 --- [IR] Generative Late-Interaction Embeddings For Visual Document Retrieval [King Abdullah University of Science and Technology (KAUST)] https://arxiv.org/abs/2609.11808 --- [AI] Beliefs and Behavior in Language Models [Toulouse School of Economics & CMU] https://arxiv.org/abs/2609.07943 --- [LG] Thinking with Looped Flows [EPFL & KAIST & University of Amsterdam] https://arxiv.org/abs/2609.11801

28分钟
82
1周前

加入我们的 Discord

与播客爱好者一起交流

立即加入

扫描微信二维码

添加微信好友,获取更多播客资讯

微信二维码

播放列表

自动播放下一个

播放列表还是空的

去找些喜欢的节目添加进来吧