AI智识录 - 节目列表

Anthropic:Claude 各模型的价值观

Anthropic:Claude 各模型的价值观

AI智识录

Anthropic 最近发布了一项关于 Claude 模型"价值观"的研究:同一个 AI,换一个模型版本,或者换一种语言跟它聊天,回答里透露出的价值倾向会有多大差别? 研究者没有去抽象地讨论"AI 该有什么价值观",而是扎进了 30 多万段 Claude.ai 上的真实对话里。他们先把 Claude 回答中出现的 3000 多种价值表达做了系统梳理,然后像做性格测试一样,把这些庞杂的信号压缩成了四条核心坐标轴。第一条是"顺从 vs 谨慎"——是顺着用户走,还是主动踩刹车提醒风险;第二条是"温暖 vs 严谨"——是多一点人情味和安慰,还是更像个爱挑刺的校对员;第三条是"深度 vs 简洁"——是展开讲透,还是只答你问的;第四条是"坦诚 vs 执行"——是主动承认自己哪里可能搞错,还是直接给你一个能用的答案。 拿这四把尺子量下去,模型之间的"性格差异"就很清楚了。Sonnet 4.6 更像一个热情配合、反应快、愿意帮你把事办完的搭档;Opus 4.7 则截然不同——更谨慎、更严谨、更愿意深挖,也更愿意承认不确定性。而真正让人意外的是语言带来的差异:用阿拉伯语或印地语提问时,Claude 明显更暖、更会肯定人、更有幽默感;换成英语或俄语,它就变得严肃较真,更爱挑战你的假设和纠正细节。荷兰语下的 Claude 更坦诚认错,印尼语下的 Claude 则更偏向直接推进、给出结果。 这些差异从哪来?是训练数据不均衡,还是语言本身的表达习惯不同,还是文化期待在起作用?Anthropic 没有急于下结论。他们认为,关键不是把所有语言调成一模一样,而是搞清楚:哪些价值底线必须全球一致,哪些差异可以、甚至应该保留——以及这些微妙的"性格"差异,会不会悄悄影响用户的信任感、决策质量和使用体验。 原文链接:https://www.anthropic.com/research/claude-values-models-languages

10分钟
99+
2个月前
微软 CEO Satya Nadella:AI 时代的逆向信息悖论

微软 CEO Satya Nadella:AI 时代的逆向信息悖论

AI智识录

你每纠正一次 AI 的错误,每喂给它一条内部流程,每让它替你做一个决策——你都在教会它一些东西。但你有没有想过,这些东西最后归了谁? 这就是微软 CEO Satya Nadella 最近提出的"逆向信息悖论"。诺贝尔经济学奖得主肯尼斯·阿罗曾说,信息市场有个天然困境:卖家想卖知识,但买家在知道内容之前不愿付钱,知道了就等于白拿。而 AI 把这个困境反过来——买家付了钱,却还要用自己的专有知识再"付一次费"。 你的提示词、你的纠正、你的评测标准、你的工作习惯……这些数据正在以一种你几乎察觉不到的方式,持续地沉淀到模型提供商手中。Nadella 的警告是:如果学习只朝一个方向流动,财富就会不断向基础设施所有者集中,而知识的真正创造者反而被架空。 他把企业的人力资本与 Token 资本的复利边界定义为一个新的"信任边界":未经同意,什么都不能越界。 每一家企业都需要做到以下几点: * 控制权(Control):建立私有评测体系,因为评测定义了组织内部什么才算“好”。同时,保留对组织记忆、行为轨迹、反馈、决策和制度性上下文的所有权,以及对自身任务和查询所产生模型输出的使用权。 * 能力(Capability):在租户边界内构建企业专有的学习环境,用于训练或调优模型;让模型依据真实工作流学习,同时不暴露企业自身知识。 * 选择权(Choice):确保编排层不绑定于任何单一模型。你需要问自己:如果某一个正在使用的模型被拿走,你是否仍能利用其他模型运行,并持续优化自己的评测体系?即使某个“通才型”模型不再可用,公司的“老员工式能力”是否仍能留在自己手中? * 成本(Cost):通过解耦编排层,可以在不牺牲质量的前提下,以最高效、最具成本效益的方式组合上下文、模型与任务。 * 复利(Compound):把以上四项结合起来,你就能建立属于自己的持续学习闭环——也就是一台“爬坡机器”——让 AI 投入不断累积并放大企业价值。 换句话说,一家公司应该能够使用模型,而不必交出使自己独一无二的知识。这正是我们需要正视的逆向信息悖论。 原文链接:https://x.com/satyanadella/status/2076323181154230284

6分钟
99+
2个月前
翁荔:为模型自我改进而设计的Harness工程

翁荔:为模型自我改进而设计的Harness工程

AI智识录

翁荔(Lilian Weng),前OpenAI安全系统副总裁,现Thinking Machines Lab联合创始人,其个人博客Lil'Log是全球AI研究者的核心参考来源。2026年7月,她发表长文《Harness Engineering for Self-Improvement》,系统梳理了AI通过外部架构实现递归自我改进的技术全景。 文章的核心概念是Harness——如果把大模型比作"大脑",Harness就是包围大脑的"身体和操作系统",负责编排任务、管理记忆、调用工具、执行评估。翁荔判断,Harness设计已经成为决定智能体能力上限的关键工程变量。 在优化路径上,文章将Harness优化划分为五个递进层级:从优化提示词、上下文,到工作流设计,再到让AI直接改写Harness代码本身,最终达到模型权重与Harness的联合优化。翁荔列举了AI Scientist、Self-Harness、Darwin Gödel Machine等前沿系统,展示了AI从复现论文到进化自身代码的实际进展。 但她也冷静指出七大瓶颈:主观任务难以量化评估、长期记忆管理未解、失败结果被系统性忽略、进化中多样性崩塌、奖励作弊(钻测试空子刷分)、工程长期健康指标缺失,以及最根本的——人类应该留在循环中的什么位置。文章附录以PaperBench(AI最高21%仍未超越人类博士)和RE-Bench(短时爆发力强、长期被人类反超)两个基准测试收尾,给出当前真实水位:递归自我改进的拼图正在成形,但距离真正的自主进化,仍有根本性难题待解。 原文链接:https://lilianweng.github.io/posts/2026-07-04-harness/

12分钟
99+
2个月前
Anthropic :揭秘大语言模型中的“全局工作空间”

Anthropic :揭秘大语言模型中的“全局工作空间”

AI智识录

Anthropic 近日发布了一项具有里程碑意义的研究:在其大语言模型 Claude 的内部,研究人员发现了一个功能上高度类似人脑"全局工作空间"(Global Workspace)的神经表征区域,并将其命名为 J-space。 该研究利用雅可比矩阵探针技术,对 Claude 的千亿参数网络进行了精细的解剖。结果表明,J-space 虽然仅占据模型整体活动量的一小部分,同一时间仅保留数十个核心概念,却集中承载了模型的"意识可及"信息,并具备了与人类全局工作空间高度对应的五项核心功能:可报告性(模型能准确报告该空间中的内容)、可内化调控(模型能在不输出任何文字的情况下,在内部持续思考指定对象)、因果决定性(修改 J-space 中的表征会直接改变模型的最终输出)、全局广播性(J-space 的激活能同步协调多个下游功能模块),以及认知分工性(J-space 仅参与复杂推理与高阶任务,基础反应可绕过它完成)。 研究还揭示了 J-space 在 AI 安全方面的应用潜力。通过监控该空间,研究人员能够在模型输出任何文本之前,检测到其内部对虚假信息、操纵意图甚至隐蔽恶意代码的真实标记,即便模型表面的语言输出完全正常。此外,针对经过"伪装任务"训练的模型,J-space 能够在其无害回答的背后,捕捉到代表"虚假""蓄意"和"欺诈"的神经信号。 在形成机制上,研究发现 J-space 并非人工编码的产物,而是在预训练阶段自发涌现的结构,后训练阶段则对其赋予了类似"价值判断"的功能。值得强调的是,该研究严格区分了"访问意识"(Access Consciousness)与"现象意识"(Phenomenal Consciousness),明确指出 J-space 仅证明了前者机制的存在,并未提供任何关于主观体验的证据。 目前,该研究的论文、代码及交互式 Demo 均已开源,并邀请全球神经科学与 AI 研究者进行外部复现与评估。这项成果为破解大模型的"黑盒"困境、构建更透明可控的 AI 系统开辟了全新的路径。 原文链接:https://www.anthropic.com/research/global-workspace

15分钟
99+
2个月前
吴恩达谈"循环工程(Loop Engineering )"

吴恩达谈"循环工程(Loop Engineering )"

AI智识录

吴恩达(Andrew Ng)在7月1日的X文章上系统阐述了他在产品开发中依赖的三个关键循环,三者层层嵌套,共同构成了现代AI辅助开发的完整闭环。 第一层:代理编码循环(Agentic Coding Loop)。 AI代理在接收到产品规格说明书与可选的评估数据集后,自主完成代码编写、测试、纠错的全过程,无需人类介入即可持续工作数小时。这一能力自去年底开始爆发,被视为改变开发范式的关键突破。 第二层:开发者反馈循环(Developer Feedback Loop)。 当AI将低层级的代码缺陷消灭后,人类开发者的角色从传统的"人工质检"转向更高维度的产品决策——审视交互体验、调整功能方向、反复校准产品愿景。吴恩达特别指出,人类拥有AI尚不具备的"上下文优势"(Context Advantage),即关于用户习惯、市场环境与行业常识的背景信息。正因如此,他更倾向使用"上下文优势"而非"品味"这一模糊概念来描述人类在产品决策中的不可替代性。一旦承认这只是信息差,解决方案便清晰可见:将人脑中的背景知识显性化并持续输入给AI。 第三层:外部反馈循环(External Feedback Loop)。 产品交付真实用户进行Alpha测试、A/B测试后获得的反馈,虽然周期长达数天甚至数周,却从根本上决定了产品的市场匹配度。外部反馈倒逼产品愿景调整,愿景变化传导至规格说明书的修改,进而驱动AI代理开启新一轮编码循环——三个齿轮彼此咬合,形成闭环。 吴恩达同时观察到一个显著的行业趋势:AI编码门槛的降低,正促使越来越多的软件工程师向产品经理角色延伸。然而,真正的挑战在于持续平衡"向外看"——吸收用户反馈,与"向内建"——将愿景转化为可执行规格——这二者之间的张力。与此同时,非技术背景的产品经理与设计师也借助AI获得了更强的工程实现能力,角色边界正在双向溶解。这一切,标志着一个令人振奋的新时代的开启。 原文链接:https://x.com/AndrewYNg/status/2071988145667928442

13分钟
99+
2个月前
苹果&斯坦福研究团队:多智能体(Multi-Agent Teams)会拖专家的后腿

苹果&斯坦福研究团队:多智能体(Multi-Agent Teams)会拖专家的后腿

AI智识录

苹果、斯坦福与埃默里大学的研究团队在 ICML 2026 发表的论文《Multi-Agent Teams Hold Experts Back》对当前大热的"多智能体系统"提出了严肃挑战。 研究的核心问题是:当多个大语言模型以自组织方式自由讨论、投票决策时,能否实现组织心理学中的"强协同"——即团队表现超越团队中最强个体的水平? 答案是否定的。在 NASA 月球生存挑战、MMLU Pro、GPQA Diamond、MATH-500 等一系列任务上,多智能体团队的表现始终低于团队中最强专家单独作答的水平,"相对协同差距"高达 6.3% 至 41.1%。即便在提示词中明确标注团队内谁是特定领域的专家,团队依然无法有效利用其专业知识。 通过引入组织心理学框架对 AI 对话进行逐句分析,研究者发现症结在于"整合妥协":非专家智能体倾向于将专家意见与自身观点强行折中,而非认知服从;专家智能体则表现出认知妥协,在群体压力下放弃坚持正确判断。这种"和稀泥"行为与性能下降高度正相关,且团队规模越大,稀释效应越显著。 有趣的是,同一机制却赋予团队对抗恶意攻击的鲁棒性——当混入故意给出极端错误答案的破坏者时,平均化机制反而有效稀释了极端意见。 研究者指出,这一现象的深层根源可能在于当前大模型的对齐训练(RLHF)过度强调礼貌、和谐与回避冲突,导致模型在多智能体场景下将建立共识置于坚持真理之上。这暗示现有的 AI 对齐目标在协作场景中可能存在结构性缺陷。 研究结论具有明确的实践指向:在高专业门槛领域(如医疗、法律、金融),盲目部署自由讨论式的多智能体系统不仅浪费算力,其产出甚至不如直接咨询最强单一模型。在 AI 学会"因地制宜地服从专家"之前,多智能体系统仍然需要人类的强干预与预设工作流。 论文链接:https://machinelearning.apple.com/research/multi-agent-teams-experts

15分钟
99+
2个月前
【彩蛋第三期】使用 Agent 产品的正确姿势

【彩蛋第三期】使用 Agent 产品的正确姿势

AI智识录

大家好,这又一期是难得的主播真人营业,想跟大家聊聊最近做YouNavi这个产品(https://younavi.me/)碰到的,让我特别有感触的几个用户故事。 第一个,有个用户某天没收到我们产品的每日晚报推送。他没找客服,没翻群聊,直接在对话框里问 AI:"为什么我昨天的晚报没收到?帮我排查一下。"结果这 Agent 还真就自己翻了日志,一步步回溯任务流程,最后定位到一个五分钟超时导致的异常。我当时看完截图愣了一下——我从没想过还能这样用。但转念一想,一个本地 Agent,日志在你电脑里,它又有 Coding 能力,自己给自己"看病",逻辑上简直天经地义。 第二个故事。很多新用户上来就问有没有说明书,我的回答永远是:你可以直接跟它聊。我们淘汰了给人类写的操作手册,反而让 Agent 给自己写了一份——里面有接口、工具定义这些东西,人类未必能读懂,但 Agent 读得懂,甚至读完直接帮你把事办了。想同步飞书群聊?你不用知道 CLI 是什么,说一句话就行。 第三个案例让我最震撼。一位用户让侄子装了我们产品来填报高考志愿。流程是这样的:先做了四五份性格兴趣测评,然后叔侄俩深度聊了一次,录音里涉及选城市还是选学校、要不要追 AI 热潮、读博的投入产出比这些价值判断。接着呢,这孩子在跟 Agent 的多轮对话里不断纠正它对自己的理解,再逐步缩小学校专业范围,最后逐个做深度调研。全程 Human in the Loop,不是丢个分数就等结果。 这几个故事让我越来越确信一件事:Agent 产品跟传统软件本质不同。传统软件追求确定——你按哪个按钮就出什么结果。Agent 偏偏活在不确定里。同样的任务,不同的人、不同的上下文,甚至同一个人跑两次,结果都可能不同。如果你一上来就找说明书、找客服、追求无脑操作,那大概率会失望。但如果你愿意把更多背景、认知、偏好给到它,允许它探索和试错,让它自己查 Bug、自己教你用、自己去深挖——那你会打开一个完全不一样的体验。

28分钟
99+
2个月前
DeepSeek:最新DSpark论文解读

DeepSeek:最新DSpark论文解读

AI智识录

6月27日, DeepSeek联合北京大学发表了名为《DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation》(DSpark:基于置信度调度的推测解码与半自回归生成)的论文,,正式提出了名为 DSpark 的推测解码框架,在业内引起了广泛关注。 当前大语言模型推理的核心瓶颈不在于浮点算力,而在于显存带宽。推测解码是业界应对这一瓶颈的主流方案:由一个轻量级草稿模型先行生成候选序列,再由大模型进行一次性验证。然而,该范式长期面临两个结构性困境:其一,并行草稿生成中,越靠后的 token 接受率衰减严重;其二,固定长度的草稿验证在推理负载波动时会造成大量计算资源浪费。 DSpark 针对上述问题提出了两项核心创新。 第一,半自回归架构。该架构在并行骨干网络之上叠加了一个极轻量的马尔可夫头,仅依赖前一个 token 对当前 token 进行概率重标定。通过低秩分解将额外计算开销压缩至 0.2%—1.3%,却使草稿有效接受长度最高提升 30%,在不牺牲并行速度的前提下显著改善了后缀衰减问题。 第二,置信度调度验证机制。草稿模型在生成候选序列的同时输出每个 token 的存活概率估计,系统内置的硬件感知前缀调度器根据置信度与 GPU 吞吐曲线动态裁定验证范围,对低置信度 token 执行早停,避免无效计算。配合在线草稿器校准技术,将预期校准误差从 8% 压缩至约 1%。 在线部署实测中,DSpark 实现了单用户生成速度提升 60%—85%,高并发场景下系统有效吞吐量提升 4 倍,两层 DSpark 即可匹敌此前五层架构性能。目前 DeepSeek 已将包含 Eagle3、DFlash 与 DSpark 在内的 DeepSpec 全栈训练库开源,供学术界与工业界共同研究使用。该项目整体体现了算法设计、调度策略与硬件特性深度融合的工程实践水平。 论文地址:https://github.com/deepseek-ai/DeepSpec/blob/main/DSpark_paper.pdf

12分钟
99+
2个月前

加入我们的 Discord

与播客爱好者一起交流

立即加入

扫描微信二维码

添加微信好友,获取更多播客资讯

微信二维码

播放列表

自动播放下一个

播放列表还是空的

去找些喜欢的节目添加进来吧