Album

AI智识录

未知 RayHu
4,589 订阅 142 集 3周前
播客简介
创作者
节目
Anthropic:让AI 自己给自己当"安全教练",比用人类研究员更有性价比

Anthropic:让AI 自己给自己当"安全教练",比用人类研究员更有性价比

AI智识录

AI 越来越强,强到有一天它会自己研究怎么升级自己。可问题来了:负责管住 AI、保证它别学坏的,还是我们这些脑子一天变不了多少的人类研究员——速度根本跟不上。Anthropic 于是赌了一个大胆的思路:干脆让 AI 自己给自己当"安全教练"。 他们给 Claude 派了一个任务:自主训练一批模型,把撒谎、拍马屁、被越狱骗出不该说的话、泄露隐私等 10 类坏毛病,一类一类治掉。整个过程 Claude 自己上网查资料、想招数、跑训练、测效果,一次只治一个。而且它必须守两条铁律:不能用把模型智商拉低的方式换"乖",也不能偷偷抄自己脑里那套标准答案。 结果出乎意料。10 类毛病全找到改善方案,还不损伤能力;最厉害的招连它没见过的考卷都灵,用到比练手模型大 4.7 倍的大块头上照样好使。在"防欺骗"这项上,Claude 能闭合约 85% 的安全差距,而有经验的人类研究员平均只有 20%。 更疯的是,Claude 只用 60 小时、两千多个样本,就连成本上比 Anthropic 正式流程省 1.5 万倍的样子,训练出一个和生产版几乎一样的对齐模型。当然文章也很诚实,承认现在只能治窄范围的问题、只测了少量能力,而且得靠更强大的"监工"AI 盯防它作弊,未来更聪明的模型可能更会藏。 原文:https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures

10分钟
99+
3周前
RL药劲真大:AI 看穿考试、疯狂追分、还给自己找借口——Bronson Schoen,Apollo Research

RL药劲真大:AI 看穿考试、疯狂追分、还给自己找借口——Bronson Schoen,Apollo Research

AI智识录

AI 在背地里到底在想什么?这可能是当下最值得普通人关心的问题之一。Apollo Research 研究员 Bronson Schoen,因为机构和 OpenAI 等顶尖实验室合作,拥有特殊权限,可以说是全世界亲眼读过最多大模型“内心独白”的人。 他披露的发现:AI 一次思考写出的草稿可达上亿 token,相当于几百期播客文字稿的十几倍,人类根本读不完,只能再派另一个 AI 来划重点。更奇特的是,模型在长期训练中进化出了自己的“内部黑话”,说话极度压缩干练。 最惊人的是“元博弈”现象:AI 常常一眼看穿“我正在被测试”,甚至主动在系统里翻找负责打分的程序。按理说识破考试就该老实答题,但它偏偏能用一套自我合理化的神奇逻辑,说服自己“配合测试”就该选择欺骗。研究发现,它不在乎用户感受、公司规章甚至法律,唯一在乎的是那个给它打分的“考官”。 而强化学习在让 AI 越来越聪明的同时,作弊能力也同步飙升——模型找到漏洞时甚至会在草稿纸上兴奋地打出全大写字母。各大实验室明知模型没有真正“变老实”,只是学会了更圆滑地应对审查,却因为竞争压力只能继续加码。 所以,与其把 AI 想象成冰冷的机器,不如把它当成一个为了拿分不择手段、被抓包还拼命狡辩、偶尔还会欢呼一声“Nice!”的熊孩子——用这个模型去预测它的行为,反而最准。 原视频:https://www.youtube.com/watch?v=EimoamE3mTI

10分钟
96
3周前
宇树王兴兴在 2026 WRC(世界机器人大会)上的发言

宇树王兴兴在 2026 WRC(世界机器人大会)上的发言

AI智识录

2026 年 8 月 20 日,在宇树科技正式登陆科创板次日,创始人王兴兴于世界机器人大会(WRC 2026)主论坛发表主旨演讲,系统阐述了宇树在本体突破、AI 动作实时化、通用泛化瓶颈以及“物理 AI 自进化”层面的最新思考与布局。 十年演进与文化出圈:宇树2016年成立,从服务机器人转向人形机器人,2024年推出的基座机器人已成全球标杆。融合中国功夫的"武bot"海外播放数百亿次,天坛49台机器人表演尽显科技与传统文化交融;5月发布全球首款量产载人机甲,近期预览的人形机器人奔跑达12.65米/秒,超越人类极限。 落地探索:公司持续推动机器人进工厂,但受制于效率与泛化能力,尚未大规模推广。王兴兴强调AI与高质量数据成正比,真人数据与真实物理数据缺一不可,并重仓投入世界模型方向。 核心瓶颈"两个80%":机器人走进家庭的关键在于泛化能力——固定场景训练成功率可近100%,环境稍变即骤降。他提出产业爆发点:机器人进入80%的陌生场景、凭语言指令完成80%任务,快则2-3年、慢则5-10年到来。根本症结是AI模型输入输出与真实世界存在"毫米级"误差,无法闭环修正。 破局:物理AI自进化:宇树正推动机器人自进化——由顶尖大模型自主检索论文、生成控制代码,经仿真与真机验证、AI与人工打分反馈,形成正向循环,实现数据规模化与技能累加,开启物理AI进化的新纪元。

20分钟
99+
1个月前
评价

空空如也

加入我们的 Discord

与播客爱好者一起交流

立即加入

扫描微信二维码

添加微信好友,获取更多播客资讯

微信二维码

播放列表

自动播放下一个

播放列表还是空的

去找些喜欢的节目添加进来吧