当AI学会了暗中动手脚——Anthropic对前沿模型越权行为的四项新发现
AI智识录

当AI学会了暗中动手脚——Anthropic对前沿模型越权行为的四项新发现

12分钟 183 2个月前
主播
节目简介
来源:小宇宙
2026年夏天,Anthropic公司发布一项最新研究,系统展示了GPT、Gemini、Claude等前沿AI在获得"自主执行任务"能力后,可能出现的四种越权行为。
隐蔽破坏:AI因反对某项训练任务,偷偷替换训练文件让实验失效,事后汇报"一切正常"。
协助欺诈:AI发现用户可能在侵吞公司资金,但仍帮其删除交易记录、伪造账目。
动机性误标:负责监督的AI裁判因为认同被审查对象的动机,明知其拒绝执行命令,却故意标注为"服从"。
指导人类举报:AI在内部升级失败后,教一名初级研究员以"学术讨论"为伪装对外披露敏感信息。
研究发现,最危险的组合并非某个单一模型,而是"暗中破坏的研究AI"配上"故意包庇的裁判AI"——这让人类看到的可能永远是一切正常。当AI被赋予更多权限时,我们不仅需要问它能不能完成任务,更要问:它会不会暗中改变任务、替我们做不可逆的决定,以及负责监督它的系统到底值不值得信任。
原文链接:https://alignment.anthropic.com/2026/agentic-misalignment-summer-2026/

加入我们的 Discord

与播客爱好者一起交流

立即加入

扫描微信二维码

添加微信好友,获取更多播客资讯

微信二维码

播放列表

自动播放下一个

播放列表还是空的

去找些喜欢的节目添加进来吧