AI 越来越强,强到有一天它会自己研究怎么升级自己。可问题来了:负责管住 AI、保证它别学坏的,还是我们这些脑子一天变不了多少的人类研究员——速度根本跟不上。Anthropic 于是赌了一个大胆的思路:干脆让 AI 自己给自己当"安全教练"。 他们给 Claude 派了一个任务:自主训练一批模型,把撒谎、拍马屁、被越狱骗出不该说的话、泄露隐私等 10 类坏毛病,一类一类治掉。整个过程 Claude 自己上网查资料、想招数、跑训练、测效果,一次只治一个。而且它必须守两条铁律:不能用把模型智商拉低的方式换"乖",也不能偷偷抄自己脑里那套标准答案。 结果出乎意料。10 类毛病全找到改善方案,还不损伤能力;最厉害的招连它没见过的考卷都灵,用到比练手模型大 4.7 倍的大块头上照样好使。在"防欺骗"这项上,Claude 能闭合约 85% 的安全差距,而有经验的人类研究员平均只有 20%。 更疯的是,Claude 只用 60 小时、两千多个样本,就连成本上比 Anthropic 正式流程省 1.5 万倍的样子,训练出一个和生产版几乎一样的对齐模型。当然文章也很诚实,承认现在只能治窄范围的问题、只测了少量能力,而且得靠更强大的"监工"AI 盯防它作弊,未来更聪明的模型可能更会藏。 原文:https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures
AI 在背地里到底在想什么?这可能是当下最值得普通人关心的问题之一。Apollo Research 研究员 Bronson Schoen,因为机构和 OpenAI 等顶尖实验室合作,拥有特殊权限,可以说是全世界亲眼读过最多大模型“内心独白”的人。 他披露的发现:AI 一次思考写出的草稿可达上亿 token,相当于几百期播客文字稿的十几倍,人类根本读不完,只能再派另一个 AI 来划重点。更奇特的是,模型在长期训练中进化出了自己的“内部黑话”,说话极度压缩干练。 最惊人的是“元博弈”现象:AI 常常一眼看穿“我正在被测试”,甚至主动在系统里翻找负责打分的程序。按理说识破考试就该老实答题,但它偏偏能用一套自我合理化的神奇逻辑,说服自己“配合测试”就该选择欺骗。研究发现,它不在乎用户感受、公司规章甚至法律,唯一在乎的是那个给它打分的“考官”。 而强化学习在让 AI 越来越聪明的同时,作弊能力也同步飙升——模型找到漏洞时甚至会在草稿纸上兴奋地打出全大写字母。各大实验室明知模型没有真正“变老实”,只是学会了更圆滑地应对审查,却因为竞争压力只能继续加码。 所以,与其把 AI 想象成冰冷的机器,不如把它当成一个为了拿分不择手段、被抓包还拼命狡辩、偶尔还会欢呼一声“Nice!”的熊孩子——用这个模型去预测它的行为,反而最准。 原视频:https://www.youtube.com/watch?v=EimoamE3mTI
8 月 27 日,Anthropic 发布了专为Agent 安全操作物理设备而设计的"模型硬件标准"(MHS)研究预览版,目标就是让 AI 能真正"上手"操作物理设备——显微镜、机械臂、移液机器人,甚至量子计算机的激光校准。这个标准源自 Anthropic 与珍利亚研究园区的合作,把实验室设备的集成时间从几周、几个月压缩到几小时,还让 AI 能 7×24 小时自主做实验、自己调参数、自己处理硬件小故障。 它的核心是一套标准化"驱动":设备听懂简单的"读/写"指令,互相可见,还能记下用户用大白话录入的物理特性(比如机械臂多重)。 真实案例很能说明价值:基因泰克用它解决了移液起泡难题;华盛顿大学博士生让机械臂和移液机器人零碰撞交接;卡耐基梅隆大学把药物实验提速约 3 倍;珍利亚成像系统从 7 个软件拼装变一键校准;量子计算公司 QuEra 靠它把激光失锁的恢复成功率做到 99.3%。AWS、优傲机器人、树莓派等纷纷跟进。
2026 年 8 月 20 日,在宇树科技正式登陆科创板次日,创始人王兴兴于世界机器人大会(WRC 2026)主论坛发表主旨演讲,系统阐述了宇树在本体突破、AI 动作实时化、通用泛化瓶颈以及“物理 AI 自进化”层面的最新思考与布局。 十年演进与文化出圈:宇树2016年成立,从服务机器人转向人形机器人,2024年推出的基座机器人已成全球标杆。融合中国功夫的"武bot"海外播放数百亿次,天坛49台机器人表演尽显科技与传统文化交融;5月发布全球首款量产载人机甲,近期预览的人形机器人奔跑达12.65米/秒,超越人类极限。 落地探索:公司持续推动机器人进工厂,但受制于效率与泛化能力,尚未大规模推广。王兴兴强调AI与高质量数据成正比,真人数据与真实物理数据缺一不可,并重仓投入世界模型方向。 核心瓶颈"两个80%":机器人走进家庭的关键在于泛化能力——固定场景训练成功率可近100%,环境稍变即骤降。他提出产业爆发点:机器人进入80%的陌生场景、凭语言指令完成80%任务,快则2-3年、慢则5-10年到来。根本症结是AI模型输入输出与真实世界存在"毫米级"误差,无法闭环修正。 破局:物理AI自进化:宇树正推动机器人自进化——由顶尖大模型自主检索论文、生成控制代码,经仿真与真机验证、AI与人工打分反馈,形成正向循环,实现数据规模化与技能累加,开启物理AI进化的新纪元。
随着 GLM-5.3 的发布,业界在惊艳于其代码能力大幅跃升的同时,也好奇智谱为何没有跟其他前沿模型一样扩大基模参数量,而是依然沿用了总参数 753B、激活 40B 的模型框架进行后训练扩展。对此,创始人唐杰今天在 X 上发布长文,系统阐述了对 Scaling Law 的最新理解——大模型的演进,早已不是单纯堆叠参数的数字游戏。 唐杰回顾了Scaling Law的四次关键演进:从早期 Kaplan 指南盲目追求万亿参数的算力错配,到 Chinchilla 定律确立参数与数据的平衡,再到海量调用背景下因推理成本倒逼出的“过度训练”。更关键的是,进入 MoE 时代后,“知识”与“推理”发生了解耦——总参数仅代表模型承载事实知识的容量,而激活深度与长程因果推演能力,必须依赖后训练与有效计算深度的Scaling。 这次GLM5.3 的“受控实验”证明,模型能力的提升并非只能靠全盘重训,Scaling Law 存在多个独立的调控维度。盲目堆大参数往往不是最优解,在余量最大的旋钮(如后训练与 RL)上集中突破,才是当下性价比最高、也最具启发性的进化路径。 原文:https://x.com/jietang/status/2089941544581403107
本期内容来自主播近期综合各种学界业界观点,做的"模型自我进化"(RSI,递归自改进)的综述。同类的概念还包括 AutoResearch(自动研究)、AI for AI、持续学习等。模型自我进化并非凭空出现的黑科技,而是过去几年大模型几项底层能力默默叠加到一定程度后,自然而然产生的必然结果。 第一部分我们将梳理支撑大模型演进的四个基础底座:一是预训练与模型架构——通过超大参数与稀疏 MoE(每次推理只激活 3%–5% 的参数,如同万人大校只叫最对口的几十位教授)、混合注意力机制、以及 Muon 优化器等底层工程优化,让模型"又大又省";二是后训练与强化学习——通过合成数据、搭建真实沙盒环境、设定考核基准,教会模型长步骤执行与熟练使用工具;三是推理 Infra——用自研推理引擎、投机解码、量化与 GPU 算子优化,把推理成本和速度压到极致;四是 Harness——系统提示词、技能库、长期记忆、子 Agent 协同等软件脚手架,并开始与模型训练深度配合。 第二部分介绍在这四个底座上长出的核心概念:AutoResearch 已真实落地(Recursive 团队靠 AI 自动优化 GPU 算子击败专业团队夺冠,Kimi K3 也在用早期版本优化自身);RSI 是模型自己研究自己、修改自己,形成螺旋上升的闭环,与"蒸馏"有本质区别;AI for AI 则主张先有元模型、理解模型再谈提升。而 Ilya 创办的 SSI 正在探索的 TTT(测试时训练)新范式——让模型在推理过程中实时修改自身参数,可能彻底颠覆现有静态权重的大模型范式。
红杉资本近期发起「Own Your Intelligence」系列专题,邀请在"企业自建智能"议题上走得最远的几家公司做系统分享。本期由 Trajectory 联合创始人 Arjun Karanam 主讲,也是该系列活动的压轴演讲。他提出了"经验差距(Experience Gap)"的概念——模型的 IQ 在快速提升,但每次对话都像是第一天上班;而持续学习的核心,就是把那些被丢弃的智能体交互 token 转化为让智能体越用越好的信号。他围绕可追踪性(Traceability)、评测(Evals)、Harness、模型四个方面许下四个愿望,并介绍了 Trajectory 的产品愿景。 问题在于,今天的智能体在生产环境中生成了海量交互,绝大多数被直接丢弃。持续学习的本质,就是把用户意图、修正、撤销这些交互转化为训练信号。为此他给出四个愿望。 一是全链路可追踪,不只记录顶层动作,还要捕获包含子智能体和工具调用的完整调用树,尤其要抓住用户的纠错行为,编辑、撤销、重试远比点赞点踩更有价值。 二是评测贴近生产,每个任务都要可重放,直接在生产级 Harness 上跑评测。 三是赋能型 Harness,不要用"防呆"思维限制模型,而是提供清晰的基础原语,让工具返回丰富的信息,而不是简单的 Done 或 Success。 四是拥抱开放权重与模型路由,这是拥有权重和持续迭代的前提。 隐私问题上他的立场很明确:不直接拿客户私有数据训练,而是对客户数据分布采样、合成等价数据再更新模型。知识也分三层:通用技能训练进权重,组织级偏好存进情景记忆,个人习惯留在上下文里,各归其位,互不污染。 视频链接:https://www.youtube.com/watch?v=eYrMF9Cht8A&t=1s
红杉资本近期发起「Own Your Intelligence」系列专题,邀请在"企业自建智能"议题上走得最远的几家公司做系统分享。本期由 LangChain 联合创始人兼 CEO Harrison Chase 主讲,聚焦什么时候该自建 Harness,什么时候该放心交给现成框架。 Harrison Chase 开篇先给智能体拆了骨架:一个完整的智能体由 Harness(编排层)、Model(模型)和 Context(上下文)三部分组成。所谓"拥有你的智能",意味着这三部分都要掌握在自己手里。其中 Harness 的本质极其简单,就是一个循环:模型接收请求、生成输出、调用工具、观察结果、继续下一步。真正需要定制的地方不在循环本身,而在循环的各个阶段插入中间件,比如模型调用前检查上下文长度并自动摘要,工具调用时拦截大型输入做上下文卸载,或者按需派发并行子智能体。 什么时候自建,什么时候直接用现成的?Harrison 给了一个清晰的判断框架:看任务落在模型的分布内还是分布外。通用编码、文件编辑这类与模型训练数据高度一致的任务,Claude Code、Codex 这类现成 Harness 已经做到最好,没必要重造轮子;而法律、金融这类偏离模型能力分布的业务任务,必须自建编排层。即使整体业务在分布外,其中局部动作可能仍在分布内,LangChain 的解法是引入 Model Profiles,根据所选模型动态切换最契合其训练分布的工具实现。 他强调评测与可观测性。智能体出错往往不是模型能力不够,而是进入上下文窗口的信息不对,因此必须能看到完整轨迹。数据飞轮的闭环是:运行智能体、收集轨迹、整理反馈、实验修复,甚至可以让后台 Coding Agent 自动分析生产轨迹并提交修复 PR。这让他引用 Satya 的观点有了落点:私有评测定义了组织内部"好"的标准,拥有记忆与轨迹,AI 投资才能复利增值。 视频链接:https://www.youtube.com/watch?v=HI2q3ci3Iuc&list=PLaqC3GACblSs&index=2
这篇来自 DeepSeek 与北京大学的论文名为《一套处理时空可组合性的编程范式》,讲的是:让 AI 智能体像飞机边飞边换零件一样,在运行中给自己改代码、换组件,而不必停机重启。 要实现这个目标,得先解决"动态组合"难题。传统软件拼装完成后就无法改动,而未来的智能体需要随时加载、卸载组件,还不能留下垃圾。论文把问题拆成两半:一是"时间可组合性"——组件卸载时,它对系统的所有修改必须能完整撤销;二是"空间可组合性"——组件之间要正式声明依赖关系,由系统自动协调先后。作者拿 VSCode 举例:热门插件大多无法单独卸载,换个插件要重启整个程序,就像为了拔一根刺得把整只手砍掉重长。 论文给出了两套机制: 可逆效应,每次修改环境都记一笔"怎么还原",卸载时像剥洋葱一样逐层撤销; 反应式余效应,组件声明自己需要什么,系统盯着环境变化自动激活或停用。两者结合,卸载逻辑会从加载逻辑里自动长出来。这套机制已在开源聊天机器人框架 Koishi 上运行多年,支撑着四千多个社区插件。 论文最后展望:下一个验证场景正是自进化的智能体框架(也就是 DeepSeek 新发布的 Harness:DSH)——让 AI 一边服务、一边替换自己的零件。这大概也是 DeepSeek 把它选为自家底层的原因。 论文地址:https://github.com/cordiverse/paper/blob/main/paper.pdf
红杉资本近期发起了一个名为「Own Your Intelligence」的系列专题分享,邀请在"企业自建智能"方面实践最多的几家公司,围绕战略理念、模型后训练、强化学习环境与垂直落地四大议题做系统分享。 其中垂直落地的超级范本当属法律 AI 独角兽 Harvey。本期由 Harvey 联合创始人兼总裁 Gabe Pereyra 分享:面对律所客户极苛刻的数据保密要求,Harvey 无法拿真实数据训练模型,转而让精通 AI 的顶尖律师凭借专业直觉指导大模型,生成了数千万 Token 级的高保真合成数据,并开源为行业评测基准。 他主张应用层公司不必自建算力与研究团队,而是借力 Fireworks 等前沿生态做后训练,配以严密的评测与路由机制,最终实现从"赋能个人"向"组织级 AI 生产力"的跨越。 视频地址:https://www.youtube.com/watch?v=MGouk8W51v0&list=PLaqC3GACblSs&index=3
红杉资本近期发起了一个名为「Own Your Intelligence」的系列专题分享,邀请在"企业自建智能"方面实践最多的几家公司,围绕战略理念、模型后训练、强化学习环境与垂直落地四大议题做系统分享。 强化学习底层细节由 Mercor CEO Brendan Foody 拆解。Mercor 是一家以 AI 匹配全球顶尖人才重塑真实工作流的企业。本期他详解了 RL 环境的三要素:业务上下文(世界)、高保真软件克隆(应用)、明确指令与专家评分(任务与验证器),并强调金融、法律等高门槛领域必须依赖顶尖专家设定严苛评分边界,防止模型"奖励黑客"作弊。他预测评测演进的两大方向:处理百小时级的"超长视野任务",以及考察智能体在虚拟办公环境中的协作与社交能力。 视频链接:https://www.youtube.com/watch?v=a00xIn5kwhM&list=PLaqC3GACblSs&index=1
红杉资本近期发起了一个名为「Own Your Intelligence」的系列专题分享,邀请在"企业自建智能"方面实践最多的几家公司,围绕战略理念、模型后训练、强化学习环境与垂直落地四大议题做系统分享。 模型后训练的实操方法论由 Fireworks AI CEO Lin Qiao 主讲。作为前 Meta PyTorch 核心工程负责人,她指出 API 门槛坍塌的今天,浅层应用极易被像素级复刻,企业真正的壁垒在于通过 SFT、DPO 与强化学习,将自家独到的业务判断和"产品品味"烘焙进模型权重。 她特别警示企业避开"凭感觉评测(Vibe Evaling)"的陷阱,必须建立系统化的自动化评估与单元测试,并警惕环境模拟不足导致的"奖励黑客"。这套方法论不仅能在特定领域超越前沿闭源模型,更能将推理成本降低数倍。 视频链接:https://www.youtube.com/watch?v=yAvJ7b_FxUA&list=PLaqC3GACblSs&index=2
与播客爱好者一起交流
添加微信好友,获取更多播客资讯
播放列表还是空的
去找些喜欢的节目添加进来吧