Album

晚点聊 LateTalk

《晚点 LatePost》的播客

MasterPa、曼祺_MatchQ、王与桐 晚点 LatePost 商业 · 商务
18.07万 订阅 177 集 4天前
播客简介
《晚点聊 LateTalk》由《晚点 LatePost》出品。 最一手的科技访谈,最真实的从业者思考。
节目
177: 详解Kimi K3:强到冲击Anthropic估值的模型什么样?

177: 详解Kimi K3:强到冲击Anthropic估值的模型什么样?

晚点聊 LateTalk

「开源了权重,没开源产生权重的 “流水线”。」 本期我们邀请 RadixArk 创始成员赵晨阳和华盛顿大学博士生曾致远,从推理与算法两条线拆解 K3:它真的比肩 fable 吗?3T 开放权重、混合注意力和智能体训练环境意味着什么?以及开源模型真正开放了什么、又保留了什么? 晨阳是老朋友,他曾在 163 期节目中为我们从 Infra 角度解读了 DeepSeek-V4。在 UCLA 读博期间,晨阳成为 SGLang 核心开发者,SGLang 第一时间适配了 V4 、K3、GLM 5.2 等中国开源模型。 曾致远目前在华盛顿大学读博士二年级,研究大语言模型,师从 Hannaneh Hajishirzi 教授和 Pang Wei Koh 助理教授。 进入具体的技术报告解读前,我们也聊了 K3 如今在美国 AI 界和更广泛的投资市场所引起的巨大关注,以及与 K3 直接相关的开源大辩论。 下面,正式进入节目吧。 本期嘉宾: * 赵晨阳,RadixArk 与 SGLang 创始成员 * 曾致远,华盛顿大学计算机科学博士生 本期主播: * 曼祺,《晚点 LatePost》科技报道负责人 时间线跳转: -K3 为什么成为里程碑 05:13 使用体感:长程任务、惊艳的前端能力与被吐槽的不足 11:15 K3 引发的开源、安全与估值大辩论 16:50 Transformer 的「忒修斯之船」 25:34 贵不贵、慢不慢,看单价之外的任务总成本 29:25 K3 为什么现在慢?新架构、Serving Stack 与前缀复用 34:42 权重一旦开放就收不回;真正的护城河在环境、验证和算力 -KDA(K3 采用的注意力) 和 KDA(kenerl 开发 agent),说不好哪个更伟大? 39:36 架构总览:让信息沿序列与深度更高效流动 42:42 Quantile Balancing:近千个专家如何保持负载均衡 48:38 KDA+MLA:线性注意力与全局注意力并非二选一 54:12 线性注意力下,百万上下文如何缓解遗忘 57:27 线性注意力给推理系统带来的工程变化 01:00:54 6.3 倍解码加速来自哪里 01:03:34 Attention Residuals:让深层模型选择性读取浅层信息 -优化器、后训练与自动研究 01:10:23 Per-head Muon 与大规模训练稳定性 01:14:46 AI 能否自己发明优化器 01:20:34 MOPD:九个领域专家为什么先分后合 01:27:11 蒸馏的纯技术定义、on-policy 蒸馏与 off-policy 蒸馏的区别 -Infra 优化 01:31:08 KDA 结构下,投机采样回退机制的变化 01:39:47 Flash KDA、QAT 与训练—推理一致 -后面有什么? 01:46:50 下一个开源最强,以及开源能否超过闭源 01:48:29 持续学习、评测与模型平台期 剪辑:甜食 相关链接: Kimi K3 官方技术博客 Kimi K3: Open Frontier Intelligence(技术报告) Kimi Linear: An Expressive, Efficient Attention Architecture Open Weights and American AI Leadership 163 期:详解 DeepSeek V4:Infra 巨鲸、百万上下文走进现实、极致效率优化 143 期:阿里、Kimi 都在用的 DeltaNet 是什么?|与杨松琳聊线性注意力新改进 104 期:我给线性注意力找“金主”,字节 say No,MiniMax say Yes 103 期:用 Attention 串起大模型优化史,详解 DeepSeek、Kimi 最新注意力机制改进 详解 DeepSeek V4:Infra 巨鲸“四连击”,百万上下文走进现实 再谈注意力:阿里、Kimi 都在用的 DeltaNet 和线性注意力新改进丨晚点播客 3700 次预训练寻找“线性注意力”非共识,MiniMax-01 开发者讲述 4 年探索 大模型“注意力简史”:与两位 AI 研究者从 DeepSeek、Kimi 最新改进聊起 附录: * KDA(Kimi Delta Attention):Kimi 提出的线性注意力机制,用固定大小的循环状态压缩历史信息,降低长上下文的计算与存储开销。 * Flash KDA:KDA 的高性能 Kernel 实现,通过重叠 chunk 内计算与 chunk 间状态传输,减少计算空转。 * Kernel Development Agent(KDA):用于编写、测试和优化 GPU Kernel 的智能体;缩写同样是 KDA。 * MLA(Multi-head Latent Attention):通过低秩表示压缩 Key-Value Cache;K3 用少量 MLA 层补充对全局上下文的直接访问。 * 混合注意力(Hybrid Attention):在同一模型中组合不同注意力机制;K3 采用 3 层 KDA 搭配 1 层 MLA。 * NoPE(No Positional Encoding):不显式加入位置编码,序列位置信息主要由 KDA 的递推、门控与衰减提供。 * Attention Residuals(AttnRes):让模型选择性读取较浅层的历史表示,改善信息沿深度方向的流动。 mHC(Manifold-Constrained Hyper-Connections):DeepSeek V4 的多通路残差连接方案,与 AttnRes 都用于改善层间信息流。 * MoE(Mixture of Experts):每个 token 只激活少数专家子网络,以较低计算量承载更大的总参数规模。 * Stable LatentMoE:K3 的 MoE 方案,共有 896 个路由专家,每个 token 激活其中 16 个。 * 负载均衡(Load Balancing)与 Quantile Balancing:负载均衡避免 token 过度集中到少数专家;K3 按路由分数的分位数分配专家。 * Muon、MuonClip 与 Per-Head Muon:Muon 对更新方向做近似正交化;K2 用 MuonClip 稳定注意力,K3 则按注意力头分别优化。 * 知识蒸馏(Knowledge Distillation):让教师模型把能力传递给学生模型,可用于模型压缩或多种能力合并。 * Checkpoint:训练过程中保存的模型参数及相关状态快照,可用于恢复、比较或更新模型。 * 消融实验(Ablation Study):移除或替换某个组件并比较效果,以判断它是否真正有贡献。 * MOPD(Multi-Teacher On-Policy Distillation):K3 先训练多个领域教师,再把它们的能力在线蒸馏进统一学生模型。 * On-policy 蒸馏:学生生成轨迹,教师对这些轨迹提供监督,数据分布更贴近学生当前策略。 * Off-policy 蒸馏:学生学习教师预先生成的数据,实施更方便,但可能存在分布偏移。 * 投机采样(Speculative Decoding):小模型先猜一批 token,大模型再集中验证,以提高生成速度。 * 前缀缓存(Prefix Cache):复用相同提示词前缀的中间计算结果,避免重复计算。 * Persistent Rollout:未完成的长轨迹可暂停并在后续轮次继续,减少长尾任务对整批采样的阻塞。 * Off-policy Mismatch:训练数据并非由当前模型策略生成,常来自旧 Checkpoint 或不同的推理配置。 * Agent 训练环境与 Harness:环境提供工具、沙箱和奖励;Harness 组织提示词、工具、上下文、Skills 与 Memory。 * QAT(Quantization-Aware Training):训练时模拟低精度计算,让模型提前适应量化误差。 * 忒修斯之船(Ship of Theseus):节目用这一比喻形容部件不断被替换、却仍沿用 Transformer 名字的模型架构。 * 持续学习(Continual Learning)与 RSI:持续学习指模型从新任务和反馈中继续更新;RSI 指系统递归改进自身能力。 小红书@曼祺_火柴Q即刻@曼祺_火柴Q ☆《晚点聊 LateTalk》建立「 播客听友群」啦!☆ 欢迎关注科技、商业大公司动态和创业创新的小伙伴进群交流,第一时间收听新节目。 这里有更多互动,更多话题讨论。欢迎贡献选题 & 推荐嘉宾。 请先添加「晚点」小助手的微信号,备注:“晚点聊”,我们邀请您入群。 关注公众号《晚点 LatePost》和《晚点对话》,阅读更多商业、科技文章:

115分钟
6k+
4天前
176: 姚顺雨,来到腾讯300天

176: 姚顺雨,来到腾讯300天

晚点聊 LateTalk

「少帅加入、组织换血、co-design、微信 vs 混元。」 本期,我和《晚点 LatePost》主笔高洪浩一起聊他最近写过的一个主题:姚顺雨,这位去年下半年加入腾讯的 29 岁年轻 AI leader,给混元乃至腾讯带来的改变。洪浩长期跟踪腾讯和字节的发展。 相关报道见:《当一个年轻人空降改造腾讯混元的 300 天》。 相比文章,播客里洪浩分享了更多他的个人观察和主观感受,同时更多展开了这篇文章里没有详述,但重要的一个议题:微信的 WeLM(他们自己的大模型团队)和混元之间的关系?微信和腾讯的基础大模型未来可能会进一步做怎样的联动和融合?最后,我们也从腾讯延展地聊到了模型和应用力量对比的变化,以及中国大模型领域的更多竞争:第一梯队模型是否足以定义胜负,以及从 Coding 走向更广泛知识工作者时,AI 商业化的下一次拐点何时出现。 混元希望把模型与应用更紧密地连接起来;微信则出于用户规模、资源效率和隐私控制,继续推进自己的 VLM。 面对算力约束和更集中的对手,腾讯需要改变自己,更 “拧成一股绳” 吗?还是保留过去帮助它不断长出新业务的联邦结构? 本期嘉宾:高洪浩,《晚点 LatePost》主笔 本期主播:曼祺,《晚点 LatePost》科技报道负责人 时间线跳转: -从低谷回升:混元 3 背后的节奏与争议 02:19 报道之外:组织上升期里的暗流 05:04 Kimi K3 之后,“小模型” 路线的两种声音 -姚顺雨为何选择腾讯 07:46 腾讯为什么要找一个年轻 Leader 13:09 从 AI Lab 赛马到一个 “残缺的组织” 18:41 姚顺雨的 “下半场” 判断:腾讯的 Context 为什么有吸引力 -空降改革:先换人,再重建组织 26:01 多模态并入,姚顺雨的 Scope 持续扩大 27:29 两三个月换掉关键岗位 35:04 一个不像 “纯技术 Leader” 的组织型管理者 41:45 刘炽平的支持:钱、人、算力和时间 44:17 混元 3 第一炮:目标不是登顶,而是重振士气 -模型走向应用:腾讯如何组织一场 AI 产品战 49:27 强化学习平台与模型—产品协作 52:04 把 AI 原生产品集中到 CSIG 56:15 内部强化学习平台从 WorkBuddy、元宝开始 -微信、混元与腾讯的组织惯性 57:45 混元和微信:模型之间 “没有很直接的关系” 01:07:45 为什么微信 WeLM 和混元大概率会长期并存 01:10:19 “联邦制” 腾讯需要和能拧成一股绳吗? 01:17:43 改革的第二阶段:成绩与文化兼容 -谁能留在牌桌:AI 竞争的下一轮判断 01:21:38 后来居上的标准:先拿出第一梯队模型 01:27:02 如果今年底再写 BAT AI 竞争,主题会是什么? 01:29:39 从程序员到白领,商业化爆发速度还会那么快吗? 01:33:27 泡沫何时扩散:今年下半年的转折 01:35:38 连点成线: 延伸推荐 剪辑:甜食 相关链接: 《当一个年轻人空降:改造腾讯混元的 300 天》 《字节、阿里、腾讯 AI 大战全记录:一场影响命运的战争》 《腾讯在 AI 拐点到来前的 700 天》 《大模型创业潮:狂飙 180 天》 《大厂大模型:久违的一把手工程》 姚顺雨博客:The Second Half 163 期:详解 DeepSeekV4:Infra 巨鲸、百万上下文走进现实、极致效率优化 158 期:V4 发布前的 DeepSeek:人才竞争、组织特点和独特的 AGI 目标|Solo 153 期:阿里 Qwen 人事变动:误读、近况、伏笔和未来|solo 150 期:〖年末 AI 回顾〗从模型到应用、从技术到商战,拽住洪流中的意义之线|Solo 106 期:与真格戴雨森长聊 Agent:各行业都会遭遇 “李世石时刻”,Attention is not all you need|Agent#1 93 期:字节 VS 六小龙,大模型创业生存战 | 串台「十字路口 Crossing」 小红书@曼祺_火柴Q即刻@曼祺_火柴Q 小红书@高洪浩 ALaNGo 即刻@高洪浩 ALaNGo ☆《晚点聊 LateTalk》建立「 播客听友群」啦!☆ 欢迎关注科技、商业大公司动态和创业创新的小伙伴进群交流,第一时间收听新节目。 这里有更多互动,更多话题讨论。欢迎贡献选题 & 推荐嘉宾。 请先添加「晚点」小助手的微信号,备注:“晚点聊”,我们邀请您入群。 关注公众号《晚点 LatePost》和《晚点对话》,阅读更多商业、科技文章:

99分钟
56k+
1周前
175: 对话Liblib陈冕:关于活下来,以及所有接近死亡的时刻

175: 对话Liblib陈冕:关于活下来,以及所有接近死亡的时刻

晚点聊 LateTalk

「“我这种焦虑型性格,可能是被这个时代选中了。”」 为什么一家看起来中国最成功的 AI 应用公司,同时也可能是最危险的一家? 演语科技 Evoken,旗下有 Liblib、Lovart、LibTV 三个产品,ARR 超过 3 亿美元。在 AI 应用融资最艰难的时候,它以 20 亿美元估值,一笔融了 3 亿美元。 围绕这家公司的争议也同时达到顶峰:有人质疑它缺少原创;有人认为它靠激进定价换增长;离开的人说它不够技术、不够创新,甚至有投资人判断,它迟早会爆雷。 这种矛盾可能不只属于 Evoken——这一代 AI 应用公司都活在同一个特殊处境里:今天属于应用的价值,明天可能就被模型覆盖。 本期节目节选自我们与 Evoken 创始人陈冕的一次长采访。 和陈冕对话,最先让人注意到的是他的笑声。洪亮、密集,说到兴奋处会大笑,甚至有点结巴。他极度焦虑,觉得公司“完蛋了”时会哭,想通新的方向后,又立刻觉得一切都有可能。 焦虑、速度和侵略性,是陈冕的性格,也是 Evoken 的生存策略。他将这种策略用到了极致——过去三年,这家公司就这样活下来:一个方向出现,迅速扑进去;模型能力变化,原来的空间开始坍塌,就再寻找下一个 陈冕回应了对他和 Evoken 的争议,以及这场对话中我们最想追问的问题:在一个模型不断吞噬应用价值的时代,一家独立的 AI 应用公司,要怎样 “survive” 到应用时代真正到来的那一天? 本期节目已发布图文版,对话 Liblib 陈冕:关于活下来,以及所有接近死亡的时刻 本期嘉宾:陈冕,演语科技 Evoken 创始人 本期主播:《晚点 LatePost》记者 剪辑:甜食 时间线: -“我有两个关于误解的神奇体验” 4:10 爆雷?投流多?补贴多? 8:21 不能自爆式打法,但不是负毛利 11:01 LibTV 3.9 折会员的由来,还在探索高 Token 消耗的生产力产品商业模式 19:26 “不侵略性强,我怎么厉害呢?我不厉害,我怎么活下来呢?” -创业第一仗,没有上一代互联网成功的手感 21:42 只剩 4000 块的故事,其实只有 600 万的时候就慌了 28:35 创业后新体会,英雄也会改变时势 -第一个发现 PMF,和最终赢得市场差十万八千里 34:51 LibTV 的原创度争议和收购传闻的来源 42:11 关于投流的误解,可能来源于饱和式信息攻击 -完蛋了,后院起火了 49:20 管理的两个 reward model,我没有做好 54:20 联创离开 58:01 拜托创新是有成本的,应用公司没法有自由探索的创新 01:08:36 Lovart 上线前的完蛋时刻,第一次对股东哭了 01:19:32 团队出问题,从美国飞回来解决 -在模型厂商的缝隙里 “survive” 01:28:10 逐鹿中原与占领江东:没法说明白的 survive 路径 01:37:17 成功概率小,但我 bet 人类有没有价值 01:46:09 网瘾少年、金庸迷和话剧演员 01:57:37 AI 时代奖励焦虑的人 02:05:55 创业三年反思:开了一辆极快的车 相关链接: 136 期:Sora 新世界 & Lovart 4 个月复盘 | 与陈冕聊怎么做垂类 Agent ☆《晚点聊 LateTalk》建立「 播客听友群」啦!☆ 欢迎关注科技、商业大公司动态和创业创新的小伙伴进群交流,第一时间收听新节目。 这里有更多互动,更多话题讨论。欢迎贡献选题 & 推荐嘉宾。 请先添加「晚点」小助手的微信号,备注:“晚点聊”,我们邀请您入群。 关注公众号《晚点 LatePost》和《晚点对话》,阅读更多商业、科技文章:

128分钟
32k+
1周前
174: AI冲击企业软件巨头?与SAP原欣聊大模型to B的颠覆与边界

174: AI冲击企业软件巨头?与SAP原欣聊大模型to B的颠覆与边界

晚点聊 LateTalk

「企业想用好 AI,仍逃不掉数据、流程、业务理解和组织变革。」 本期嘉宾,是 SAP 大中华地区总裁原欣。 SAP 起家于 ERP(企业资源计划)。这家总部位于德国沃尔多夫的公司,自 1972 年创立至今五十余年,已成长为全球企业级软件巨头,全球百强企业中绝大多数都是它的客户。但 2026 年以来,AI coding 能力突飞猛进,掀起大模型 To B 热潮,SAP 这类老牌企业软件公司也开始面对挑战与质疑。 他们已经在行动。近年来,SAP 与 Anthropic、Google、微软、AWS、NVIDIA 等厂商深化 AI 合作,在中国市场则与阿里云合作。今年 5 月,SAP 在蓝宝石大会上发布“自主运营企业”(Autonomous Enterprise)愿景,同步推出支撑这一愿景的 SAP 商业AI平台与SAP自主型管理套件,以及面向用户的全新交互层 Joule Work——用户只需用自然语言描述目标,Joule 会完成流程、数据与 Agent 编排。 我们的访谈直面了 AI 对企业软件形态和市场的冲击: * 在复杂的企业级需求中,大模型的机会和边界是什么? * SAP 数十年积累的数据、流程和行业 know-how,哪些仍是壁垒,哪些会被 AI “颠覆”? * 从 “模型即产品” 到 “自主运营企业”,从按坐席收费到按用量、按结果收费,企业软件的产品与商业模式将如何变化? * 最近火热的 FDE 潮流又是否会持续? 原欣自 1998 年以来有近 30 年企业市场经验,先后在甲骨文、VMware、微软等公司工作。她也分享了多年观察企业转型得到的判断:AI 不会让数据治理、流程梳理和组织变革自动消失;技术从小圈子的狂欢外溢到更广泛的企业世界,仍然要经过漫长、具体的业务落地过程。 本期节目由 SAP 支持播出。 本期嘉宾:原欣,SAP 大中华地区总裁 本期主播:程曼祺,《晚点 LatePost》科技报道负责人 时间线: -AI coding 冲击企业软件:什么会消失,什么仍是壁垒 02:51 从 ERP 起家的全球企业软件巨头 12:59 AI coding 来了,但业务逻辑和标准流程仍有价值 22:29 “日抛式软件” 可以满足临时需求,大企业仍需要信任和合规 -从记录系统到执行系统:SAP 的 “自主运营企业” 战略 27:18 AI 会让大公司消失吗?拆散与聚合的力量同时存在 32:30 “自主运营企业”:Agent 执行,但未来 5 到 10 年仍需 human in the loop 37:31 为什么 SAP 不自己训练通用基础模型? 42:39 “模型即产品” 在 To B 市场成立吗? 44:58 企业用 AI 的落差:老板说 “我也要”,但脏数据不会自动消失 47:30 把 “老师傅” 蒸出来:非结构化决策如何沉淀为企业记忆 -FDE 热潮:从模型到企业价值的最后一公里 49:55 FDE 和传统驻场工程师、ERP 顾问有什么不同? 55:43 一个关务案例:Agent 准确率从六七成提升到九成以上 58:40 OpenAI、Anthropic 进入 To B,会和 SAP 正面竞争吗? -中国企业如何迎接 AI:数据、组织、出海与下一轮产业升级 01:05:21 88% 的企业尝试 AI,为什么只有 3% 认为获得了业务回报? 01:07:43 大公司有钱做实验,小公司跑得快,最挣扎的是中型企业 01:09:24 中国为什么没有长出全球 SaaS 巨头?高速增长留下的系统欠账 01:13:14 哪些行业会先采用 AI?轻资产服务业在前,制造业从市场和售后切入 01:20:34 SAP 与阿里合作:千问、阿里云、钉钉和 ERP 如何服务中国客户 01:23:20 中国企业出海:税务、合规、并购与全球流程整合 01:26:42 从本地部署、云到生成式 AI:技术周期的区别是速度,人的复杂性没有变 剪辑:甜食 相关链接: 171 期:与 Henry 的「AI 季报 26Q2」:从 coding 到 RSI,强者愈强的未来? 164 期:当 AI“杀死”SaaS,与明略吴明辉聊多 Agent 网络、软件业转型和 AI 新组织 131 期:微软怎么用 AI?与微软商用市场、广告业务管理层聊 AI 驱动的增长 98 期:李开复聊零一部分团队并入阿里:只有大厂能追逐超大模型 小红书@曼祺_火柴Q即刻@曼祺_火柴Q ☆《晚点聊 LateTalk》建立「 播客听友群」啦!☆ 欢迎关注科技、商业大公司动态和创业创新的小伙伴进群交流,第一时间收听新节目。 这里有更多互动,更多话题讨论。欢迎贡献选题 & 推荐嘉宾。 请先添加「晚点」小助手的微信号,备注:“晚点聊”,我们邀请您入群。 关注公众号《晚点 LatePost》和《晚点对话》,阅读更多商业、科技文章:

91分钟
10k+
1周前
评价

空空如也

加入我们的 Discord

与播客爱好者一起交流

立即加入

扫描微信二维码

添加微信好友,获取更多播客资讯

微信二维码

播放列表

自动播放下一个

播放列表还是空的

去找些喜欢的节目添加进来吧