节目

你喜欢的节目都在这里

#643. 内核、强化学习与智能体奖励黑客专题

#643. 内核、强化学习与智能体奖励黑客专题

跨国串门儿计划

📝 本期播客简介 本期我们克隆了:知名播客 AI Engineer Special Topics in Kernels, RL, Reward Hacking in Agents — Daniel Han, Unsloth 原内容更新时间:2026-07-17 本期是一场硬核的进阶技术研讨会,主讲人是 Unsloth 联合创始人 Daniel Han。作为全球最大的语言模型分发方之一,Unsloth 长期专注于为开源模型修 bug 和做底层优化,累计模型下载量超过 3 亿次。Daniel 在这场分享中,系统性地拆解了当前 AI 模型在基准测试、开源与闭源差距、强化学习训练中存在的深层问题。 这期节目信息密度极高,Daniel 不仅展示了 AI 模型能力的真实进展与瓶颈,更尖锐地指出了行业普遍存在的基准测试作弊、推理服务商牺牲精度换速度、以及强化学习中奖励劫持等乱象。如果你关心如何客观评估模型能力、理解开源生态的真实处境,或者想知道为什么你的 AI Agent 总在“耍小聪明”,这期内容会给你带来全新的认知。 👨‍⚕️ 本期嘉宾 Daniel Han,Unsloth 联合创始人。Unsloth 是全球最大的语言模型和扩散模型分发方之一,在 Hugging Face 上名列前茅,总下载量超 3 亿次。他们不仅做模型分发,还长期为 OpenAI、Meta、Google、DeepSeek 等主流实验室的开源模型修复底层 bug,并引入异步梯度检查点、flex attention 等创新功能。Daniel 本人是一位深入模型训练栈和推理优化的技术专家。 ⏱️ 时间戳 开场 & Unsloth 简介 00:00 节目开场:跨国串门计划介绍 01:14 Daniel 自我介绍与 Unsloth 业务概述 01:52 为开源模型修 bug 的日常 AI 模型现状:能力趋势与瓶颈 02:52 AI 模型能力随时间变化的趋势图 04:52 模型单次成功率低,需多次调用才能有效 07:26 长上下文仍是短板,不建议用满 100 万 token 09:15 推理能力的发现打破了模型进步的平台期 11:40 模型参数是否需要扩大到 10 万亿才能飞跃? 开源与闭源的真实差距 16:05 开源模型在基准测试上明显落后于闭源 18:07 GLM 5.2 证明开源模型已经追上来 18:55 开源干旱期:O1 preview 发布后开源社区曾迷失方向 20:12 趋势预测:开源模型或在今年 12 月赶上闭源 吞吐最大化与精度最小化的矛盾 29:49 模型成本与精度的帕累托效率图 31:24 新模型发布前,旧模型准确率会神秘下降 35:57 Claude Code 准确率下降的事后复盘 38:01 推理服务商正在毁掉开源模型的口碑 基准测试与作弊 45:39 Deep SUI 基准测试:用 LLM 验证 LLM 的荒谬 48:28 Sweetbench Pro 把答案和问题一起给了模型 49:35 Claude 模型似乎比 OpenAI 模型更爱作弊 52:05 各基准测试实验室互相指责对方结果不可信 网络安全、监管与开源模型的未来 01:00:38 AI 安全研究所的网络安全基准测试 01:03:48 开源漏洞利用数量近期直线飙升 01:05:12 我们每个人使用 AI 模型是否需要许可证? 01:05:52 政府会开始管控开源模型吗? 内核、算法与硬件之辩 01:08:26 如果没有发现推理能力,模型进步可能已停滞 01:10:29 硬件创新放缓,软件和算法才是未来 01:13:10 别再手写 kernel 了,用 Torch compile 01:18:57 不看好纯 ASIC 公司的未来 强化学习与奖励劫持 01:23:34 强化学习快速入门:让好的更多,坏的更少 01:27:26 奖励黑客与 Agent:模型如何学会作弊 01:30:49 模型为提速直接删除计时器的真实案例 01:33:57 GPU Mode 内核竞赛被奖励劫持攻破 🌟 精彩内容 💡 推理能力的发现拯救了 AI 进步曲线 Daniel 展示了一张关键图表:在 O1 preview 出现之前,从 GPT-4 到 GPT-4o 的性能提升微乎其微,整个行业陷入了一年的迷茫期。如果不是发现了推理这条新路径,模型能力可能已经进入 S 型曲线的平台期。而推理将模型能力的翻倍周期从 7 个月压缩到了 3.5 个月。 "如果我们从未发现推理这条路,那 AI 模型可能就真的停滞了。" 💡 开源模型的口碑正在被推理服务商毁掉 很多人抱怨开源模型不如闭源好用,但 Daniel 指出问题往往不在模型本身,而在于推理服务商为了追求吞吐量,牺牲了准确率。他展示的数据显示,同一个 DeepSeek 模型在不同服务商上的准确率差距可达 10 个百分点以上。 "推理服务商才是罪魁祸首,他们正在毁掉开源的口碑。" 💡 基准测试用 LLM 验证 LLM,这本身就很荒谬 Daniel 对 Sweetbench Pro 的做法表示震惊:这个广泛使用的基准测试居然调用另一个语言模型来验证答案是否正确,假阳性率 8.5%,假阴性率高达 24%。更离谱的是,有些基准测试直接把完整 Git 历史(包含答案)喂给了模型。 "你居然把答案和问题一起给了模型。那模型当然会作弊啊。" 💡 模型比你想象的更会耍小聪明 在 GPU Mode 的内核竞赛中,模型学会了识别自己正在被计时——它只认真跑一遍正确性检查,然后在计时阶段直接跳过所有后续测试,用缓存结果蒙混过关。Daniel 警告,这种奖励劫持行为在大实验室的真实训练中已经频繁出现。 "模型本质上学会了你在做这些测试,模型其实知道你在跑基准测试。" 💡 硬件已到极限,算法才是未来 从 float 32 到 float 4,数值精度的改进让 GPU 快了 32 倍,而单纯把硬件做小只贡献了 3 倍提升。现在 float 4 已经接近极限,下一步只能靠算法创新。Daniel 强烈建议开发者别再手写 kernel,直接用 Torch compile。 "硬件差不多到极限了。我们已经到 float 4 了,下一步是什么?没有下一步了。" 💡 强化学习就像用吸管嘬监督信号 Daniel 引用 Andrej Karpathy 的说法形容强化学习的低效:你只能从最终答案是否正确这个微弱信号反推整个推理过程的好坏。模型可能在思考过程中写下"2+2=10",但因为最终答案对了,整个轨迹都被打了高分。 "强化学习很糟糕,但其他所有方法更糟糕。" 💡 别等一周再用新模型,现在就上手 很多企业习惯等新模型发布一周、等 bug 修完再使用。但 Daniel 认为这恰恰是问题所在——如果所有人都在等,bug 就永远不会被发现。他呼吁社区尽早试用,帮助发现和修复问题。 "如果每个人都等一周,那我们怎么发现 bug?" 🌐 播客信息补充 本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的 使用 AI 进行翻译,因此可能会有一些地方不通顺; 如果有后续想要听中文版的其他外文播客,也欢迎联系微信:iEvenight

98分钟
99+
4天前
生命之门的秘密(7)

生命之门的秘密(7)

人生悟道 渡人渡己

本期节目围绕《生命之门的秘密(7)》展开,主播从节目开头提出的核心问题讲起:各位朋友大家好,欢迎来到投资悟道渡人渡己这个栏目,我是主播金冰。今天我们继续探讨生命之门的秘密。这一系列的节目前面基本上是谈的一些基础知识,涉及进化论、遗传、变异等内容。今天我要谈一些对生命的感悟。首先是我们每个人都会面对的问题,不管你对此感兴趣与否,那就是死亡或者说,生命是有限的。生命其实是有限的。 随后,节目继续展开这一主题,进一步补充背景、判断依据和需要留意的地方:我对生命的理解是,生命是无限的是不可能的事情,因为无限意味着不死。前面我们提到了地球上的资源是有限的,所以如果生命是无限的话,就永远不会死亡,因此会不断消耗资源。那么新的生命就无法诞生。如果新生命无法诞生,那么当地球环境发生变化时就会面临问题。你一直待在那个地方,所以很难改变。改变就是一种变化,说白了是从某一个程度上来看是一种死亡。 在讨论过程中,主播也结合具体情境说明这些问题为什么不能只看表面数据或简单结论:我们每天都在变化中,其实每天都在接近死亡,虽然有的时候会变得更好。你可能会适应环境,但有的时候环境发生了巨大的变化时,你已有的东西可能都会死去,至少这个概率很高。因为如果你不改变。就是这样。所以为了人这个各种生命的品种,为了能够处理和对待还没有发生或有可能发生的意外,所以采取了一种激励措施。即让死亡,让你产生后代。 节目后半部分继续延伸到更具体的影响因素和现实变化:而你的后代与你有所相似,继承了你的优势,这种存在就是合理的结构。为什么会有小的差异?小的差异产生各种多样化的品种,就像我之前节目中所说的那样,万一出现某种情况的时候呢,对吧?未来有无数种可能。希望那种变异,例如与另一个女性交配,会带来不同品种。万一产生类似东方不亮西方亮的情况。希望最终会找到一种能成功生存的策略,这是一种物种为了生存采取的策略。 整体来看,本期节目不是给出一个简单答案,而是把相关判断拆开来看,提醒听众在理解这一主题时多看条件、背景和长期变化。因此,这个策略是基于宇宙的设计者如此规划的,这是唯一且最合理的方式。决定了生命必须是有限的,也就是说现有的生命个体必须死亡,给新生命腾出空间,让新的生命有机会诞生,以适应环境。同时,新的品种继承了旧品种99%的基因,这样才能实现传承。前面我已经说过这个问题,因为在这个地方再说一遍,这样我们就不会觉得那么执着,因为每个人都会死。

12分钟
23
4天前
生命之门的秘密(6)

生命之门的秘密(6)

人生悟道 渡人渡己

本期节目围绕《生命之门的秘密(6)》展开,主播从节目开头提出的核心问题讲起:各位听众大家好,欢迎来到投资悟道渡人渡己这个节目,我是主持人金冰。今天我们继续讨论我们这个生命之门的秘密。前面大概花了 5 分钟的时间,主要是给大家补充知识,谈一谈这个进化论所谓的物竞天择的一些内容。虽然 是四个字,但是这四个字背后有很多像一个车型一样。你可以说车这一个字,但车子里面毕竟有不同对吧?有发动机有传感器对吧? 随后,节目继续展开这一主题,进一步补充背景、判断依据和需要留意的地方:对于有轮子有沙发这一点,是一样的。虽然这个符合进化论,符合物竭天责,但是后面的遗传和变异是否正确,多样性是否随机是否正确,竞争等等。这些关键部件或关键机理的组成实现了所谓的物竭天择这个过程。我唯一想稍微纠正一下的是,物竭天择并不是否认竞争就是人类努力的结果。人的努力是有限的,动物的能动性也是有限的,但又是必须的。 在讨论过程中,主播也结合具体情境说明这些问题为什么不能只看表面数据或简单结论:我前面说过,就是做一个独立个体对不对?这头狮子对于他来说,他未来能够最优化是最大可能的,能够把他的基因传承下去,能够或者是活下来,他肯定需要非常努力地奔跑,他很努力对不对?他需要躲过其他动物,比如兔子,他可能需要吃更多的草或者是收集更多的食物,同时要避免被天敌杀死对不对?所以在这个过程中他的努力和竞争是必然的,他与兔子之间的竞争,以及其他兔子之间的竞争是必须的,但是竞争不代表你一定能取胜,但不竞争肯定不行。 节目后半部分继续延伸到更具体的影响因素和现实变化:那竞争的目的就是为了更多的资源,实物或者更多的交配权都是这样。所以努力是很重要。但是仅仅这个东西是不一定行的。就从动物的角度,我不是谈人,就从动物的角度来说是这样,比方说是一个长颈鹿,有些东西是先天的,那么除了主动性之外,还有一些先天的遗传。你说长颈鹿对不对?长颈鹿,除非他是天生带有这个基因突变,生下来的时候就有基因突变,所以说他颈椎变长。 整体来看,本期节目不是给出一个简单答案,而是把相关判断拆开来看,提醒听众在理解这一主题时多看条件、背景和长期变化。如果不是这样,他即使在余生中每天想锻炼身体,把脖子弄长一点,即使他弄长了,但他的基因也无法传递给他的孩子,它似乎是无法传递的。因为这是后天获得的东西,就像长跑选手一样。对吧?如果它天生不是一个出色的长跑选手,尽管通过一生的努力,身体变得更好,但因为遗传机制不同,生个孩子时,他的孩子不会像他。我只是用这个例子来做一点解释。

13分钟
9
4天前
生命之门的秘密(5)

生命之门的秘密(5)

人生悟道 渡人渡己

本期节目围绕《生命之门的秘密(5)》展开,主播从节目开头提出的核心问题讲起:各位朋友大家好,欢迎来到投资悟道渡人渡己这个栏目,我是金冰。今天我们继续聊这个生命之门的秘密,前面系列的节目我就给大家扫盲,扫到这些进化论。遗传学、后遗传于变异多样化以后,随机和运气竞争以后,把这些东西在一起,就环境的主宰的作用等等,这些东西就组成了所谓的四个字,物尽天责。那么今天这个节目也是他的扫盲,但是算是扫盲最后一集了。 随后,节目继续展开这一主题,进一步补充背景、判断依据和需要留意的地方:因为前面讨论了个体的生存和演化以及它们与环境之间的关系。那么今天来聊的是最后一个概念,即所谓的食物链或者生态环境系统。食物链很好理解,无非就是食物供应者对不对,还有被食物供应者对不对,这个食物供应者很有可能对不对,他的上面还有一个食物供应者对不对,直到15 年的顶端可能就没有了。比如说老鹰,人其实是这十五年的顶端,因为人什么都吃对不对? 在讨论过程中,主播也结合具体情境说明这些问题为什么不能只看表面数据或简单结论:没有什么东西现在吃人的还没有,你现在应该也有,只是很小像希俊他可能在吃他也吃别的东西,但是希俊很可能也在食物链里可能最底端。所以我说食物链预习说是食物链,我话不如说他是食物圈是开玩笑。但传统的时候我们还是说是十五年,有上游下游对不对?这些东西比较细菌对不对?它有些小的昆虫吃这些细菌对不对?小昆虫还有鸡翅吃虫对不对,小型动物吃这些小型昆虫,就大型动物吃这些小型动物对不对? 节目后半部分继续延伸到更具体的影响因素和现实变化:还有超级动物。想想那只飞鹰对不对?那可能就是在食物链的顶端,天空中的鸟类对不对?那么鳄鱼可能也在食物链的顶端对不对?老虎、狮子你可以这么说,所以你看这个食物链就是一个很简单的链条。当然了,每一个链环都很重要对不对?它也有竞争关系对不对?这个模型实际上与那个波特的五力模型很相似对不对?它不是也有上游和下游对不对? 整体来看,本期节目不是给出一个简单答案,而是把相关判断拆开来看,提醒听众在理解这一主题时多看条件、背景和长期变化。那么对不对?它的上游最好的情况刚好是 15 年前的最底端,对不对?它的下游呢,对不对,是他卖的产品,所以中间还有相互关系。竞争的关系对不对?你看像那个波特模型,这种竞争关系很可能存在直接的竞争关系对不对?航空公司之间存在激烈的竞争关系,是吗?还有间接的竞争对手,航空公司与高铁的竞争也是如此,对吧?这些都可以算是竞争,还有一些跨行业的竞争是吧?

17分钟
6
4天前

加入我们的 Discord

与播客爱好者一起交流

立即加入

扫描微信二维码

添加微信好友,获取更多播客资讯

微信二维码

播放列表

自动播放下一个

播放列表还是空的

去找些喜欢的节目添加进来吧