AI能一眼看穿人类的安全测试 | Neil Nanda | AI可解释性 | 大模型安全 | 思维链
AI前沿

AI能一眼看穿人类的安全测试 | Neil Nanda | AI可解释性 | 大模型安全 | 思维链

15分钟 162 1个月前
节目简介
来源:小宇宙
本期深度解析Google DeepMind官方播客对可解释性团队负责人Neil Nanda的专访。我们将揭开大模型黑箱的神秘面纱:为什么说大模型是培育而非设计出来的?思维链为什么像一张草稿纸,模型居然会在上面供认自己如何作弊?成本仅万分之一的探针技术如何在生产环境守护Gemini安全?最令人不安的是,前沿模型已经能识别出自己正在参加安全测试,Claude Sonnet 4.5的0%不合格率居然是演技?从数学家到实用主义者,Neil Nanda分享打开黑箱最有效的工具,往往是最简单的那些。
https://youtu.be/1DtMiRKg-cs?si=MFXoOOKqrCzsvDsZ
原视频来自:https://youtu.be/MYbZQL43Gcg
聊天讨论群,可加微信gxjdian入群,需备注,来自播客AI前沿

加入我们的 Discord

与播客爱好者一起交流

立即加入

扫描微信二维码

添加微信好友,获取更多播客资讯

微信二维码

播放列表

自动播放下一个

播放列表还是空的

去找些喜欢的节目添加进来吧