主播
节目简介
来源:小宇宙
“模型困在自己训练的语料里,他吃进去的语料实际上是他的枷锁。”
“RSI 就是——你先靠人类智慧堆出一个够聪明的模型,然后它自己从外界获取信息,自己迭代。”
“许愿式编程:你满足了当下的要求,但后果是拆东墙补西墙。”
“人类能抽象出牛顿第二定律,模型只能记住所有落地的轨迹——这是本质区别。”
“先扎马步,扎六个月,不要想九阴真经——这才是大智慧。”
“越有智慧的人越不屑于黑 NASA,但一个受过训练的 19 岁高中生可以——他们训练的也许是黑化的爱因斯坦。”
嘉宾:王铁震 |前Hugging Face APAC Ecosystem Head | Linkedin联络方式
完整无删节版本请看视频播客 ▶️YouTube链接
免责申明:本节目的所有内容都并非旨在提供任何形式的建议,包括但不限于投资、税收、会计或法律上的任何建议。
时间核心话题
00:00 – 02:00Q2 的 AI 世界恍如隔世,GM5.2 已取代 OpenAI 4.8 成为主力工具;开源模型斩杀线持续上移。
02:00 – 06:30RSI(递归自我改进) 与 auto research 的区别:前者是“编译自己”,让模型自己优化自己;后者是优化外部目标。RSI 更像循环闭环。
06:30 – 10:00RSI 无法达到 100% 自主,人类参与比例虽递减但不可归零;代码生成行数虽多,但指令和架构仍由人类定义。
10:00 – 14:00“许愿式编程”的陷阱:AI 满足当下需求,但拆东墙补西墙,项目复杂度超限后无法维护;新模型版本成了“救火队”。
14:00 – 18:00人类的核心价值是抽象能力——将百万行代码提炼为不变量和模块;模型生成的是“始山”(spaghetti code),缺乏高屋建瓴的设计。
18:00 – 22:00模型困在自己的训练语料里,语料即枷锁;它只能组合已有方法,无法真正开拓全新领域,真正的创新仍依赖人类的“research taste”。
22:00 – 26:00数据飞轮:交互数据(录屏、操作反馈)是模型进化的燃料;未来产品两大方向——高效收集人类智能数据 + 将智能无处不在地下发。
26:00 – 30:00Harness(工具链) 从 TUI 起步,用户体验决定胜负;不会一家垄断,类似前端框架 React 等生态共存。
30:00 – 34:00Fable的发布:marketing 成分大于范式突破;它并未改变底层逻辑,而是通过训练“恶意语料”制造能力差,本质是“黑化的爱因斯坦”。
34:00 – 38:00安全悖论:要防黑化,先学黑化;Anthropic 收集大量攻击性语料,但智能本身不等于不安全,越有智慧反而越可能克制。
38:00 – 42:00中美差距:马斯克判断中国 2027 Q1 赶上 vivo,唐杰认为更快;中国模型迭代速度已追上来,超越只是时间问题。
42:00 – 46:00开源模型的进步是所有人的进步;投资角度上,赛道虽拥挤,但开源让模型透明化,倒逼真正科研投入。
46:00 – 50:00美团龙猫:在纯国产卡集群上成功训练 1.6T 模型,工程突破巨大,说明中国厂商已能绕过 N 卡限制。
50:00 – 54:00腾讯混元三:不追新架构,扎马步式打磨数据和训练方法,性能飞跃;证明数据清洗和质量比结构创新更关键。
54:00 – 结束“Coding”是个有毒的词,本质是 Automation(自动化)——所有数字世界的工作都可被自动化
本期提到
模型
* GLM-5.2(智谱) — 王铁震口中 Q2 最受震撼的发布,已在他的实战工作流里取代 Opus 4.8——不如 Fable 聪明,但能一口气把长程任务做完。
* Opus 4.8(Anthropic) — 被他形容成会顶嘴的资深员工:任务给过去先跟你讨价还价、要求改 scope。
* Fable(Anthropic) — 本期的核心争议对象。主打 0day 漏洞挖掘和国家安全叙事,王铁震认为能力强但范式没有跃迁,发布更像是被开源斩杀线逼出来的。
* Kimi 2.5 / 2.6 — 他拿来复现 Fable 宣称的漏洞:给了 hint、把问题局部化之后同样能找到,差在海量遍历时能不能自己 spot 到。
* 混元 3(腾讯) — 本期最长的一段技术讨论。结构相比 preview 版几乎没变,只换了数据和训练方法就有巨大性能飞跃,被当作「数据 > 结构」的证据。
* LongCat 2.0(美团) — 1.6T 模型,在完全没有 N 卡的五万卡国产集群上训出来,王铁震认为工程上是非常大的突破。
* 百灵(蚂蚁) — 对照组:此前尝试在 N 卡与国产卡混合的集群上训练,LongCat 则是全国产。
* MiniMax — 传闻要做 2-3T 的开源大模型,被用来讨论「尺寸上去之后开源模型能否直接找到漏洞」。
* DeepSeek — 作为「斩杀线」这个概念最早的锚点被提起——如今线已经被推得更前。
公司
* Anthropic — 今天 ARR 第一、Q2 断层领先,但两位主播都认为它的溢价正在被开源和中国模型压缩。
* 智谱 / 唐杰 — GLM-5.2 的作者。唐杰回应马斯克「不用等到 2027 年」,隔天股价大涨。
* OpenAI / Sam Altman — Codex 并入 ChatGPT、推出 Record Replay;节目末尾被拿来做脑洞:如果有机会,他会不会买 Cursor。
* xAI / 马斯克 — 马斯克在推特上判断中国模型 2027 Q1 追上,并主张「有用的智能唯一衡量标准是收入」;xAI 收购 Cursor 被解读为买数据。
* Cursor — 在 Anthropic 已有 Claude Code、自己也推出了 Composer 的情况下仍被收购,说明这笔交易看的是人工编程数据。
* 腾讯 / 姚顺宇 / CodeBuddy — 组织架构上给了足够空间;姚顺宇不追奇技淫巧、专注扎马步式的数据清洗;CodeBuddy 内外部使用量都为模型带来数据。
* 美团 — 外卖大战打得焦头烂额,还抽空做出了 LongCat,被当作「非模型厂商也在推高斩杀线」的代表。
* Recursive — RSI 概念的旗手公司,Q2 完成大额融资,田渊栋以 co-founder 身份加入。
* 苹果 — 被看好走「智能的盒子」路线:买一次设备、模型跑在本地,卖的是隐私和不被断供。
* Meta / 小米 / Airbnb — Meta 被认为随时能翻盘回桌;小米和美团一样属于非模型厂商入场;Airbnb 则是拿开源 check point 自己微调的典型。
产品
* Claude Code — Harness 的标杆,也是「日更」的原因:难的从来不是做出来,而是极致的用户体验和安全兜底。
* Codex — 与 Claude Code 的对照——没有危险命令检测的小模型,但有 Sandbox,两条不同的解题路线。
* Record Replay(OpenAI) — 录屏学你怎么改简历、怎么筛简历,然后替你重复——Raymond 认为这正是上一期说的「劳动数据」的产品化。
* OpenCode / Cline — 证明 Harness 不会被垄断,但会像 Vue 和 React 一样收敛到少数几家做得更好的。
* vLLM / SGLang — 他 RSI 实验里「还没被自己掌控」的一环:下一步是让 GLM-5.2 自己写出自己的推理。
概念
* RSI(递归自我改进) — 本期主线。和 auto research 的区别在于:auto research 是用一个东西优化另一个东西,RSI 是把这个环接到自己身上。
* 自举 / compiler bootstrapping — 解释 RSI 用的比喻:C 语言编译器最终用 C 自己来编译自己,模型也该走到自己迭代自己。
* 100% RSI 不可能 — 他的判断:完全闭环会熵增,屎山越滚越大直到超出模型能力;必须持续从外界摄取低熵的人类 input。
* 许愿式编程 — 对结果有期盼、对过程和可复现性没有期待——像刮彩票,刮到十个亿很好,但线上出事故时你刮不出来。
* 一口气能做对的项目 size — 他给出的一个衡量模型能力的实用指标:两万行的原型现在能一次跑对,往上加就开始六亲不认。
* 白盒 / 黑盒 — 软件工程正在从人写代码的白盒,变成人定架构、机器写实现的灰盒甚至黑盒。
* research taste — 在他和 Recursive 的逻辑里都是瓶颈:现存语料会给你 137 种「这事做不成」的理由,敢不敢做网状回收火箭是人的事。
* 蒸馏与智能的网络效应 — 你从最新模型里拿到的智能,其实来自地球另一端某个人趟出来的新路径——模型厂商只是把它蒸馏了进去。
* 古法手作 — 他对上一条的回应:人得留一点自己动手的能力,否则会被锁死在模型的平均值里。
* predict the next token 的枷锁 — 模型能把 A 领域的方法搬到 B 领域,但开创一个全新的 C 领域不是它的训练目标——在语料看来那就是幻觉。
* 黑化的爱因斯坦 — 解释 Fable 的攻击能力:智能本身不等于不安全,是海量攻击语料训出了一个会黑 NASA 的爱因斯坦。
* 斩杀线 — 开源和非模型厂商不断把这条线往前推,闭源模型必须拉开一个身位才卖得动。
* 大马造小鞍 — 他 RSI 实验的路径:用 Claude Code + Fable(大马大鞍)带 GLM-5.2 造出自己的 Harness,再做推理、再做 LoRA 训练,链路就闭合了。
* coding 其实是 automation — Raymond 的非共识:code 这个词有毒、太 technical,它真正说的是「所有数字化的工作都能被自动化」。
* 数据孤岛 — 点评答不了「这个商场哪家咖啡店没人」,因为中国各家 APP 数据不打通——这也是每家大厂都要自己做模型的原因之一。
文章
* Anthropic 的 RSI 文章 — Claude Code 里 80% 的代码已由 Claude 写;文章担忧的是 recursive drift——孩子长大后开始和你不 align,而你已经管不住了,因此呼吁各国联合监管。
* 《晚点》关于混元 3 的独家深度报道 — 节目里明确说会放进 show notes。两个要点:腾讯在组织架构上给了足够空间,以及姚顺宇不追奇技淫巧、把力气全花在数据清洗上。
💡 核心观点
* 训练语料是模型的枷锁:它学习的是人类已知的“平均”,无法跳出这个边界;而人类以极慢的速度探索未知,这正是原生价值。
* 未来竞争不在模型结构,而在数据和用户体验:混元三靠数据清洗逆袭,美团靠工程落地,开源让智能商品化,但差异化在于“使用智能的脚手架”。
* 安全与恶的悖论:Dario 通过“先黑化”来防黑,但本质是收集了所有恶意手段,这本身就是一个巨大的伦理和治理挑战。
* Coding 即许愿:未来的编程不是写代码,而是用自然语言描述意图,模型自动实现——这是自动化,不是代码行数。
中文逐字稿:https://insights.mossfire.xyz/posts/ep43-llm-half-year-report/
English transcript: https://insights.mossfire.xyz/en/posts/ep43-llm-half-year-report/
“RSI 就是——你先靠人类智慧堆出一个够聪明的模型,然后它自己从外界获取信息,自己迭代。”
“许愿式编程:你满足了当下的要求,但后果是拆东墙补西墙。”
“人类能抽象出牛顿第二定律,模型只能记住所有落地的轨迹——这是本质区别。”
“先扎马步,扎六个月,不要想九阴真经——这才是大智慧。”
“越有智慧的人越不屑于黑 NASA,但一个受过训练的 19 岁高中生可以——他们训练的也许是黑化的爱因斯坦。”
嘉宾:王铁震 |前Hugging Face APAC Ecosystem Head | Linkedin联络方式
完整无删节版本请看视频播客 ▶️YouTube链接
免责申明:本节目的所有内容都并非旨在提供任何形式的建议,包括但不限于投资、税收、会计或法律上的任何建议。
时间核心话题
00:00 – 02:00Q2 的 AI 世界恍如隔世,GM5.2 已取代 OpenAI 4.8 成为主力工具;开源模型斩杀线持续上移。
02:00 – 06:30RSI(递归自我改进) 与 auto research 的区别:前者是“编译自己”,让模型自己优化自己;后者是优化外部目标。RSI 更像循环闭环。
06:30 – 10:00RSI 无法达到 100% 自主,人类参与比例虽递减但不可归零;代码生成行数虽多,但指令和架构仍由人类定义。
10:00 – 14:00“许愿式编程”的陷阱:AI 满足当下需求,但拆东墙补西墙,项目复杂度超限后无法维护;新模型版本成了“救火队”。
14:00 – 18:00人类的核心价值是抽象能力——将百万行代码提炼为不变量和模块;模型生成的是“始山”(spaghetti code),缺乏高屋建瓴的设计。
18:00 – 22:00模型困在自己的训练语料里,语料即枷锁;它只能组合已有方法,无法真正开拓全新领域,真正的创新仍依赖人类的“research taste”。
22:00 – 26:00数据飞轮:交互数据(录屏、操作反馈)是模型进化的燃料;未来产品两大方向——高效收集人类智能数据 + 将智能无处不在地下发。
26:00 – 30:00Harness(工具链) 从 TUI 起步,用户体验决定胜负;不会一家垄断,类似前端框架 React 等生态共存。
30:00 – 34:00Fable的发布:marketing 成分大于范式突破;它并未改变底层逻辑,而是通过训练“恶意语料”制造能力差,本质是“黑化的爱因斯坦”。
34:00 – 38:00安全悖论:要防黑化,先学黑化;Anthropic 收集大量攻击性语料,但智能本身不等于不安全,越有智慧反而越可能克制。
38:00 – 42:00中美差距:马斯克判断中国 2027 Q1 赶上 vivo,唐杰认为更快;中国模型迭代速度已追上来,超越只是时间问题。
42:00 – 46:00开源模型的进步是所有人的进步;投资角度上,赛道虽拥挤,但开源让模型透明化,倒逼真正科研投入。
46:00 – 50:00美团龙猫:在纯国产卡集群上成功训练 1.6T 模型,工程突破巨大,说明中国厂商已能绕过 N 卡限制。
50:00 – 54:00腾讯混元三:不追新架构,扎马步式打磨数据和训练方法,性能飞跃;证明数据清洗和质量比结构创新更关键。
54:00 – 结束“Coding”是个有毒的词,本质是 Automation(自动化)——所有数字世界的工作都可被自动化
本期提到
模型
* GLM-5.2(智谱) — 王铁震口中 Q2 最受震撼的发布,已在他的实战工作流里取代 Opus 4.8——不如 Fable 聪明,但能一口气把长程任务做完。
* Opus 4.8(Anthropic) — 被他形容成会顶嘴的资深员工:任务给过去先跟你讨价还价、要求改 scope。
* Fable(Anthropic) — 本期的核心争议对象。主打 0day 漏洞挖掘和国家安全叙事,王铁震认为能力强但范式没有跃迁,发布更像是被开源斩杀线逼出来的。
* Kimi 2.5 / 2.6 — 他拿来复现 Fable 宣称的漏洞:给了 hint、把问题局部化之后同样能找到,差在海量遍历时能不能自己 spot 到。
* 混元 3(腾讯) — 本期最长的一段技术讨论。结构相比 preview 版几乎没变,只换了数据和训练方法就有巨大性能飞跃,被当作「数据 > 结构」的证据。
* LongCat 2.0(美团) — 1.6T 模型,在完全没有 N 卡的五万卡国产集群上训出来,王铁震认为工程上是非常大的突破。
* 百灵(蚂蚁) — 对照组:此前尝试在 N 卡与国产卡混合的集群上训练,LongCat 则是全国产。
* MiniMax — 传闻要做 2-3T 的开源大模型,被用来讨论「尺寸上去之后开源模型能否直接找到漏洞」。
* DeepSeek — 作为「斩杀线」这个概念最早的锚点被提起——如今线已经被推得更前。
公司
* Anthropic — 今天 ARR 第一、Q2 断层领先,但两位主播都认为它的溢价正在被开源和中国模型压缩。
* 智谱 / 唐杰 — GLM-5.2 的作者。唐杰回应马斯克「不用等到 2027 年」,隔天股价大涨。
* OpenAI / Sam Altman — Codex 并入 ChatGPT、推出 Record Replay;节目末尾被拿来做脑洞:如果有机会,他会不会买 Cursor。
* xAI / 马斯克 — 马斯克在推特上判断中国模型 2027 Q1 追上,并主张「有用的智能唯一衡量标准是收入」;xAI 收购 Cursor 被解读为买数据。
* Cursor — 在 Anthropic 已有 Claude Code、自己也推出了 Composer 的情况下仍被收购,说明这笔交易看的是人工编程数据。
* 腾讯 / 姚顺宇 / CodeBuddy — 组织架构上给了足够空间;姚顺宇不追奇技淫巧、专注扎马步式的数据清洗;CodeBuddy 内外部使用量都为模型带来数据。
* 美团 — 外卖大战打得焦头烂额,还抽空做出了 LongCat,被当作「非模型厂商也在推高斩杀线」的代表。
* Recursive — RSI 概念的旗手公司,Q2 完成大额融资,田渊栋以 co-founder 身份加入。
* 苹果 — 被看好走「智能的盒子」路线:买一次设备、模型跑在本地,卖的是隐私和不被断供。
* Meta / 小米 / Airbnb — Meta 被认为随时能翻盘回桌;小米和美团一样属于非模型厂商入场;Airbnb 则是拿开源 check point 自己微调的典型。
产品
* Claude Code — Harness 的标杆,也是「日更」的原因:难的从来不是做出来,而是极致的用户体验和安全兜底。
* Codex — 与 Claude Code 的对照——没有危险命令检测的小模型,但有 Sandbox,两条不同的解题路线。
* Record Replay(OpenAI) — 录屏学你怎么改简历、怎么筛简历,然后替你重复——Raymond 认为这正是上一期说的「劳动数据」的产品化。
* OpenCode / Cline — 证明 Harness 不会被垄断,但会像 Vue 和 React 一样收敛到少数几家做得更好的。
* vLLM / SGLang — 他 RSI 实验里「还没被自己掌控」的一环:下一步是让 GLM-5.2 自己写出自己的推理。
概念
* RSI(递归自我改进) — 本期主线。和 auto research 的区别在于:auto research 是用一个东西优化另一个东西,RSI 是把这个环接到自己身上。
* 自举 / compiler bootstrapping — 解释 RSI 用的比喻:C 语言编译器最终用 C 自己来编译自己,模型也该走到自己迭代自己。
* 100% RSI 不可能 — 他的判断:完全闭环会熵增,屎山越滚越大直到超出模型能力;必须持续从外界摄取低熵的人类 input。
* 许愿式编程 — 对结果有期盼、对过程和可复现性没有期待——像刮彩票,刮到十个亿很好,但线上出事故时你刮不出来。
* 一口气能做对的项目 size — 他给出的一个衡量模型能力的实用指标:两万行的原型现在能一次跑对,往上加就开始六亲不认。
* 白盒 / 黑盒 — 软件工程正在从人写代码的白盒,变成人定架构、机器写实现的灰盒甚至黑盒。
* research taste — 在他和 Recursive 的逻辑里都是瓶颈:现存语料会给你 137 种「这事做不成」的理由,敢不敢做网状回收火箭是人的事。
* 蒸馏与智能的网络效应 — 你从最新模型里拿到的智能,其实来自地球另一端某个人趟出来的新路径——模型厂商只是把它蒸馏了进去。
* 古法手作 — 他对上一条的回应:人得留一点自己动手的能力,否则会被锁死在模型的平均值里。
* predict the next token 的枷锁 — 模型能把 A 领域的方法搬到 B 领域,但开创一个全新的 C 领域不是它的训练目标——在语料看来那就是幻觉。
* 黑化的爱因斯坦 — 解释 Fable 的攻击能力:智能本身不等于不安全,是海量攻击语料训出了一个会黑 NASA 的爱因斯坦。
* 斩杀线 — 开源和非模型厂商不断把这条线往前推,闭源模型必须拉开一个身位才卖得动。
* 大马造小鞍 — 他 RSI 实验的路径:用 Claude Code + Fable(大马大鞍)带 GLM-5.2 造出自己的 Harness,再做推理、再做 LoRA 训练,链路就闭合了。
* coding 其实是 automation — Raymond 的非共识:code 这个词有毒、太 technical,它真正说的是「所有数字化的工作都能被自动化」。
* 数据孤岛 — 点评答不了「这个商场哪家咖啡店没人」,因为中国各家 APP 数据不打通——这也是每家大厂都要自己做模型的原因之一。
文章
* Anthropic 的 RSI 文章 — Claude Code 里 80% 的代码已由 Claude 写;文章担忧的是 recursive drift——孩子长大后开始和你不 align,而你已经管不住了,因此呼吁各国联合监管。
* 《晚点》关于混元 3 的独家深度报道 — 节目里明确说会放进 show notes。两个要点:腾讯在组织架构上给了足够空间,以及姚顺宇不追奇技淫巧、把力气全花在数据清洗上。
💡 核心观点
* 训练语料是模型的枷锁:它学习的是人类已知的“平均”,无法跳出这个边界;而人类以极慢的速度探索未知,这正是原生价值。
* 未来竞争不在模型结构,而在数据和用户体验:混元三靠数据清洗逆袭,美团靠工程落地,开源让智能商品化,但差异化在于“使用智能的脚手架”。
* 安全与恶的悖论:Dario 通过“先黑化”来防黑,但本质是收集了所有恶意手段,这本身就是一个巨大的伦理和治理挑战。
* Coding 即许愿:未来的编程不是写代码,而是用自然语言描述意图,模型自动实现——这是自动化,不是代码行数。
中文逐字稿:https://insights.mossfire.xyz/posts/ep43-llm-half-year-report/
English transcript: https://insights.mossfire.xyz/en/posts/ep43-llm-half-year-report/