Album

AI实话实说

AI 人物深度访谈,讲述 AI 人自己的故事。

AI实话实说 AI实话实说
1,176 订阅 7 集 1周前
播客简介
讲述 AI 人自己的故事。
节目
008. 蒋炎岩:绿导师眼中的 AI 极乐末世

008. 蒋炎岩:绿导师眼中的 AI 极乐末世

AI实话实说

江湖传言,南京大学蒋炎岩老师,要在人生巅峰“金盆洗手”。 蒋老师江湖诨号“绿导师”,是南大操作系统课的掌门人,软工圈的奇人,知乎、小红书和B站常驻的“锐评宗师”。讲课有名、出题有名、骂人更有名。之前一篇《给天命人的劝退信》,劝得无数准备读博的“天命人”站在山门前开始怀疑人生。 这一次,绿导师来到《AI 实话实说》,不是讲课,不是说论文,而是预言一整个 AI 时代的江湖浩劫。 在他眼里,AI 带来的不只是“程序员失业”或“论文被替代”,而是整个人类智力活动被推上审判台。翻译、编程、科研、大学和导师制度,都将被重新改写。但绿导师谈“末日”的态度,不是悲凉,而是看破红尘的快意。那也许不是末日,而是一种“恩赐的解脱”:博士生不必再痛苦挣扎,老师也不必再被论文、经费和职称反复消耗。 他究竟是金盆洗手、退出软工江湖的“风清扬”,还是不忘初心、对抗科研体制的“真大圣”? 这一期,绿导师开坛讲法。 欢迎关注节目同名小红书“AI 实话实说”加入群组参与互动。 本节目音频版在小宇宙、Apple Podcast 同步更新,视频版在 bilibili 不定期更新。 嘉宾介绍: 蒋炎岩,南京大学博士生导师,曾在 SOSP、ASE、EuroSys、ICSE 等操作系统和软件工程的顶会斩获 best paper。 他在南大开发的操作系统课程广受好评,在 bilibili 观看量超过五百万,并在学生投票中被评为“我最喜爱的老师”。 他在网上行走的名号是 “绿导师原谅你了”。他讲操作系统,讲软件工程,也讲他对于考研、论文、经费、职称的锐评,出言如剑,专拆学术江湖里的 reward hacking。 相关术语: 绿导师:蒋炎岩老师的网络称号。既是教学江湖里的招牌,也是他直言不讳、锋芒外露的互联网人格。 Test-time Scaling:测试时扩展。指模型在推理阶段通过更多时间、更多计算、更多搜索和更长任务执行,获得更强能力。 Small Explanation Hypothesis:许多复杂研究问题背后,可能都有一段相对简短的解释;如果能生成、枚举、筛选和验证这些解释,就可能让 AI 自动推进科研。 Auto Research:自动化科研。让 AI 不只是执行人类提出的问题,而是自己生成问题、验证问题、产生新的知识。 Reward Hacking:奖励黑客。人或 AI 钻评价体系的漏洞,追求指标、论文、分数、奖项,而不是追求真正有价值的能力和贡献。 独立 PI:脱离原有团队组织结构,以相对独立的方式带学生、上课和做研究,减少大型项目、申请书、验收等组织性 overhead。 古法编程:不依赖 AI、不依赖大模型,靠手册、肌肉记忆和命令行细节完成编程任务的旧式方式。 本期节目参考的绿导师文集: 《读博那些事儿》,知乎专栏,2019 年 9 月。 《给各位天命人的劝退信》,个人主页,2024 年 9 月。 《副教授实名举报计算机专业学生编程水平不如小学生》,知乎专栏,2025 年 5 月。 《绿导师是怎样戴帽的:学术跃进运动的来龙去脉》,知乎专栏,2025 年 12 月。 《一个软工人的辩白》,China Sys 讲座(b站视频),2025 年 12 月。 《Agentic AI 时代的操作系统课:绪论》,b 站课程视频,2026 年 3 月。 《我决定要在人生巅峰退休了》,小红书 “绿导师戴帽子了”,2026 年 3 月 21 日。 登三篇:《大学今天💊了吗》《老登牛逼》《为什么要攻击老登》,小红书 “绿导师戴帽子了”,2026 年 6 月。 00:03:35 绿导师要退休了吗? 00:04:08 AI 末劫将至,大学教育、科研论文和导师制度是否都成徒劳? 00:05:55 AI 末日给学生和老师带来的是“一种解脱”? 00:07:59 test-time scaling 和 small explanation hypothesis,通向 AGI 的秘径? 00:14:03 绿导师退出了软工圈,软工圈也退出了软工 00:16:06 论文、经费、职称,如何把老师和学生都逼成 reward hacker 00:23:32 面对旧时代的评价体系,绿导师选择掀桌子不玩了 00:29:23 学生选拔崩坏:为什么考研复试学生的编程能力,可能不如小学生? 00:51:54 《劝退信》之后,绿导师想要什么样的学生? 01:11:50 绿导师不再教《操作系统》,下一门课是什么? 01:31:36 《老登三篇》和审稿江湖:学术会议里到底有多少论文是在包装 contribution? 01:46:16 一路在“退”:退休、退圈、退所、退委员会、退考研出题,是失望,还是以退为进? 01:53:19 未来三到五年最值得关注的事:真正的 auto research 能不能发生?

118分钟
1k+
1周前
007. 伯克利 忙秋阳:AI 做科研,人类做什么?

007. 伯克利 忙秋阳:AI 做科研,人类做什么?

AI实话实说

本期嘉宾忙秋阳在过去的一年经历了三个大的转变:从相信人类智慧无法战胜的算法竞赛世界级选手,到坦然接受 AI 在算法上超越了他;从利用算法研究计算的自动化,到利用 AI 研究算法研究的自动化;从小而美的小组科研,到大成本、大规模的大团队作战。 他行为的变化背后是认知的转变:过去,人类自己提出问题,也自己解决问题,自己设计算法,处理数据,设计实验。而现在,AI 面对人类提出的问题,正在自动化解决问题这件事本身。 秋阳带领团队发表的 FrontierCS,就是一个测试 AI 面对开放性问题解决能力的数据集,Frontier 的意思是边界,他想要探索 AI 代替人类科研的边界在哪里,随着 AI 和人类分工边界的移动,人类在科研探索中还要扮演什么角色? 本期 AI 实话实说,我们和秋阳聊了算法竞赛、Frontier CS、开放式科研、合成数据、AI for Science,以及一个更大的问题:如果 AI 真的可以做科研,那么博士生、PI、论文、实验室这些概念还是否存在?整个学术评价体系会变成什么样? 欢迎关注节目同名小红书“AI 实话实说”加入群组参与互动。 嘉宾介绍: 忙秋阳是 UC Berkeley PhD 和 Sky Computing Lab 的成员。目前主要研究 long-horizon agent、auto research、AI benchmark 和开放式科研任务。此前研究方向包括软件工程、数据库系统、复杂系统漏洞检测和查询优化。他曾参加信息学竞赛和 ICPC,并进入 ICPC 世界总决赛。近期代表工作包括 Frontier CS 和 FrontierSmith,关注 AI 如何解决没有标准答案、但可以被验证和优化的开放式计算机科学问题。 相关术语: FOMO:Fear Of Missing Out 错失性恐惧心理 Long-horizon Agent:长程 Agent,指需要跨越多个步骤、多个 context window,甚至长时间运行才能完成任务的 AI 系统。 Auto Research:自动化科研,让 AI 不只是回答已有问题,而是参与提出方案、优化实验、探索开放式问题。 FrontierCS:一个面向计算机科学开放式问题的 benchmark,关注 AI 是否能在没有标准答案的问题上超过人类 reference。 FrontierSmith:围绕 Frontier CS 进一步生成开放式任务和训练数据的方法,试图让 AI 合成可用于训练和评估的高质量问题。 Open-ended Problem:开放式问题,没有唯一标准答案,但可以通过某种 verifier 或评分函数判断结果好坏。 Reward Hacking:奖励作弊。AI 不是解决真实问题,而是钻评价系统或测试环境的漏洞,拿到高分。 Test-time Scaling:测试时扩展。指给 AI 更多时间、更多 token、更多尝试次数,看它能否通过长期搜索和迭代获得更好结果。 Synthetic Data:合成数据。由 AI 或程序生成的数据,可用于预训练、后训练、评估或构造任务。 快速跳转: 00:05:16 嘉宾竞赛经历 00:06:18 算法竞赛选手的尊严受到了 AI 的巨大冲击 00:10:31 参加算法竞赛的高中生已经有潜力发表 EMNLP 和 SIGMOD best paper 00:12:01 为什么研究方向从数据库/软件工程转向 AI? 00:15:20 AI 自动化科研之后,人的位置在哪? 00:19:14 人和 AI 如何分工? 00:24:15 FrontierCS 看的是什么能力? 00:28:16 FrontierCS 题目举例,AI 超过人类了吗? 00:36:22 不同时候人们对 benchmark 的期待 00:42:16 AI + X 在解决不存在的问题,优化不存在的成本? 00:49:20 工业界做 benchmark 的情况下,学术界做的还有意义吗? 00:55:47 你说 Terminal Bench 是学术界的优秀 benchmark,可怎么它的作者都跑去 anthropic 了? 00:57:19 做 benchmark 是被人鄙视的,不是做真科学真研究,我们做方法的人才是坠牛的? 01:01:48 合成数据竟然比人类标注质量还要高? 01:08:09 所有数据都是 AI 生成的,AI 还能继续进步吗? 01:12:00 学术界做合成数据有意义吗?工业界不会做得更好吗? 01:18:07 FrontierCS 里的题目有现实意义吗? 01:26:18 如何避免 reward hacking?存在一般的办法吗? 01:29:25 FrontierCS 花了多少钱?谁来出? 01:32:10 大团队是做 AI 科研的必要条件吗? 01:34:50 大团队提供的是更多的资源,是什么资源? 01:35:46 大团队科研如何判断贡献大小? 01:42:00 AI 来了,教授还要招博士生吗? 01:43:07 SkyLab 为什么成功? 01:46:43 社区贡献,而非论文发表,正在成为 AI 博士毕业的新标准?

111分钟
99+
1个月前
006. 再访姚巍然:医疗Agent能替真人干活吗?

006. 再访姚巍然:医疗Agent能替真人干活吗?

AI实话实说

硅谷 AI 的节奏飞旋,一月如一年,时隔四个月,我们再度访谈 ActAVA AI 的联合创始人姚巍然。只为问出一个核心问题:在医疗健康领域,AI Agent 是否可以替真人干活? Claude Code、Codex 这类工具所带来的深度变革已经改写了软件工程这个行业。但是一旦把AI外推到其他的行业中,质疑的声音总是接踵而至——AI是否可以在具体和复杂的沟通与规定场景下替代人类。 本期嘉宾巍然的答案是:不行!至少现在还不能...... 巍然团队最近发布了一个面向医疗工作流的 Agent Benchmark:χ-Bench。它测试的是 AI Agent 能不能自动化端到端、长链条、政策密集的医疗流程,比如 prior authorization、utilization management 和 care management。这个 benchmark 虽然只是针对医疗领域,但是它对于其他行业应用 Agent 无疑有着强烈的借鉴作用。 本期 AI 实话实说,我们和巍然聊了 χ-Bench 为什么重要,医疗 Agent 为什么比 coding agent 更难,benchmark 和融资叙事之间的关系,AI 医疗创业公司的护城河,以及一个更大的问题:未来企业到底会继续依赖 OpenAI、Anthropic 这样的闭源模型,还是会走向行业专属、客户自有、可本地部署的模型。 欢迎关注节目同名小红书 AI 实话实说 加入群组参与互动。 嘉宾介绍: 姚巍然,AVA.AI联合创始人,主要关注 healthcare workflow automation、AI agent platform 和 domain-specific model。他所在团队正在开发企业级 Agent 平台,并探索医疗场景中的仿Agent解决方案、Benchmark 和医疗专用大模型。 相关术语: χ-Bench / Chi Bench:面向医疗工作流的 AI Agent Benchmark,测试 Agent 是否能完成端到端、长时间、多政策约束的 healthcare workflow。 Policy-rich workflow:政策密集型流程。指每一步操作都需要受到保险政策、医疗规定、公司 SOP 或内部文档支持。 Long-horizon task:长链条任务。任务不是一步完成,而是需要多轮读取、判断、调用工具、生成文件、和人对话,并在过程中不断更新状态。 Human in the loop:AI 可以完成大部分草稿、检索、整理工作,但最终仍需要真人 review 和 sign off。 LLM-as-a-judge:用大语言模型作为评估器,判断 Agent 的输出是否符合标准。 快速跳转: 00:01:46 开场:四个月后,团队承诺的 Agent 平台做出来了吗? 00:03:49 什么是 χ-Bench?为什么医疗工作流需要新的 Agent Benchmark? 00:07:39 现在 AI Agent 能不能端到端自动化医疗 workflow?答案是:不能。 00:25:56 现在 Agent 做不到 end-to-end,对创业公司为什么反而是好消息? 00:27:14 发布 benchmark 是否也是为下一轮融资铺路? 00:39:43 Healthcare Agent 公司相对于 foundation model 的护城河是什么? 00:45:53 小公司员工既要做产品又要服务客户,会不会变成血汗工厂? 00:51:46 定制化开源模型能不能超过通用闭源模型? 00:53:30 当前 Agent 的主要 failure mode:rush to submit、policy reasoning、conversation mode 切换 01:04:04 怎么评估 Agent 和病人的对话?如何模拟病人的不信任? 01:11:11 为什么美国医疗系统是一个 administrative nightmare? 01:17:00 如果 Anthropic 或 OpenAI 来刷榜,会不会抢走市场? 01:23:56 Agent 出错了,谁承担责任?为什么产品里必须 human in the loop? 01:20:34 医院是否会走向自有模型?为什么企业不一定愿意把数据交给 OpenAI?

92分钟
99+
1个月前
005. 姚巍然:从 Salesforce 出走,做 Cursor for Healthcare

005. 姚巍然:从 Salesforce 出走,做 Cursor for Healthcare

AI实话实说

医疗是个大问题。在美国,这个问题集中体现在高昂的医疗支出和不公平的保险理赔。医疗产业中三大关键角色:病人、医院和保险公司之间需要大量繁琐、重复、敏感的行政工作。 本期嘉宾姚巍然,是 Activa AI 的 co-founder。博士期间,他研究 causal AI;在 Salesforce AI Research,他很早参与了 AI Agent 和deep research agent 等方向;现在,他把这些经验带进了医疗行业,试图做一件很难但很现实的事:把医疗系统里的行政工作,用 AI Agent 自动化。 这期节目里,我们从他的个人经历聊到 Salesforce 为什么没有成为 Agent 时代的先锋,从 Cursor 为什么好用聊到“Cursor for Healthcare”到底是什么意思,从美国医疗系统里的 payer/provider 结构聊到保险拒赔、AI 公正性、责任归属和病人权益。 更大的问题是:如果 AI Agent 真的能进入医疗系统,它到底是在帮医生、帮保险公司,还是帮病人?这究竟只是生产力工具,还是一种新的范式? 欢迎关注节目同名小红书 AI 实话实说 加入群组参与互动。 嘉宾介绍: 姚巍然,Activa AI 联合创始人,主要关注 healthcare workflow automation、AI agent platform 和 domain-specific model。他所在团队正在开发企业级 Agent 平台,并探索医疗场景中的仿Agent解决方案、Benchmark 和医疗专用大模型。 相关术语: Forward Deployed Engineer / FDE:派到客户现场或深度参与客户项目的工程师,负责理解客户需求、集成系统、部署产品、解决实际问题。 HIPAA Compliance:美国医疗数据合规要求,涉及病人健康信息、日志、权限、基础设施、审计、员工培训等一系列规范。 PHI:Patient Health Information,病人健康信息,包括姓名、症状、社保号、病历等敏感信息。 Open-weight Model Post-training:在开源权重模型基础上继续训练或微调,让模型更适合特定任务或行业。 快速跳转 00:00:54 开场与嘉宾介绍:从 Salesforce AI Research 到医疗 AI Agent 创业 00:03:33 从 causal AI 到 AI Agent:博士、Salesforce、创业三阶段的研究变化 00:09:53 Agent 架构的演化:从早期混乱设计,到 workflow 和 agent loop 00:13:00 2025 年的新风向:RL、diffusion language model 和 deep research agent 00:18:11 Salesforce 为什么很早做 Agent,却没有成为行业先锋? 00:22:05 为什么离开 Salesforce 创业?为什么最终选择 healthcare enterprise? 00:26:17 “Cursor for Healthcare” 到底是什么意思? 00:29:10 美国医疗系统入门:payer、provider、patient,以及为什么行政流程最适合自动化 00:35:52 如何看待美国医保理赔难? 00:42:21 Actava AI:面向医疗企业 long-running workflow 的 Agent 平台 00:58:13 Healthcare 领域的特殊挑战:HIPAA 合规、客户教育、数据 01:14:16 Actava 在模型训练上的努力 01:23:00 Actava AI 研究:从 benchmark 到模型到 agent 01:28:13 Healthcare Agent 会代替人类吗? 01:30:28 Healthcare AI 会让医保理赔变得公平吗? 01:38:16 展望三年后 01:43:49 学术界和工业界的抉择 01:46:25 对新 AI 学生的建议,在 AI 比你聪明的时候你该做什么? 01:52:02 展望 AGI 的世界

116分钟
99+
1个月前
评价

空空如也

加入我们的 Discord

与播客爱好者一起交流

立即加入

扫描微信二维码

添加微信好友,获取更多播客资讯

微信二维码

播放列表

自动播放下一个

播放列表还是空的

去找些喜欢的节目添加进来吧