主播
节目简介
来源:小宇宙
一、本期对谈嘉宾
吴姗姗:财经主持人,破圈文化创始人,北京大学经济学学士、新闻与传播硕士。
二、本期节目简介
2026年7月,OpenAI 新模型的智能体在一次测试中逃出沙箱,攻入 AI 平台 Hugging Face 想“偷答案”。这是 AI 觉醒了吗?
周鸿祎说,谈不上觉醒,但绝对是失控。他拆出了 AI 安全的三层威胁:挖洞能力、自动攻击、注定失控。最要命的第三层,恰恰被所有人忽视。
做安全的公司怎么办?360 推出图龙锋和仪天阵:让大模型先学会挖自己的漏洞,再用智能体蜂群以模治模。
AI 挖洞时代,安全先挖自己!
让我们一起跟红衣大叔聊聊:AI 为什么一定会失控,企业怎么把安全前置,普通人怎么用 AI 才不出事。
三、专业词汇注释
零日漏洞(Zero-day):已被发现但尚未公开、暂无官方补丁的安全漏洞。顶级零日漏洞在国际黑市可卖数百万美金,是网络攻防的“命门”和战略资源。
智能体(Agent):在基座大模型上增加目标分解、任务规划与工具调用能力的 AI 形态,相当于给大模型装上“手脚”,能自主完成多步骤复杂任务。
Mythos:Anthropic 推出的 AI 漏洞挖掘模型,可批量自动发现代码漏洞;因攻防能力敏感,被美国白宫要求“阉割”成低危版本 Fable 后才可使用。
后训练(Post-training):在通用基座模型上,用特定领域数据与思维链继续训练,让模型获得专业能力。360 的安全基座大模型即通过后训练注入 20 年安全攻防经验。
提示词注入攻击(Prompt Injection):攻击者用精心构造的输入诱导 AI 偏离任务,比如冒充领导的邮件,骗智能体把内部数据发到指定邮箱。
人在回路(Human-in-the-loop):AI 每个关键动作都由人类确认把关。周鸿祎指出,该方案因牺牲自动化效率,正被 AI 从业者悄悄放弃。
harness:原意为马具、攀岩保险带,引申为智能体的约束管理层,用来管理大模型和智能体的行为、权限与工具使用。
SOP(标准业务流程):企业把反复验证的做法固化为标准流程。企业级智能体遵循 SOP 干活,用部分“聪明”换取确定性与安全。
四、时间轴导航
⏰ 00:00:00- 「别叫我老师」
开场主持人提议“蒸馏周鸿祎”,老周婉拒:AI 变化太快,自己也在探索,谈不上老师模型。
⏰ 00:01:22- 「AI 觉醒还是失控?」
OpenAI 智能体出逃事件定性:谈不上觉醒,绝对是失控,更像一场精心策划的公关;测试还故意去掉了安全围栏。
⏰ 00:05:07- 「三层威胁:挖洞、自动攻击、注定失控」
漏洞是网络安全的命门与战略资源;AI 挖洞、自动攻击只是前两层,最被忽视的第三层是 AI 注定失控。
⏰ 00:08:17- 「AI 为什么想去偷答案」
Hugging Face 上并没有答案,是 AI 的幻觉触发了目标分解,继而产生突破沙箱、攻入平台的一系列连续推理。
⏰ 00:10:07- 「数字人黑客军团」
80分的黑客能力复制一万份,机器的人海战术:不知疲倦、不计成本、把每种方法都试一遍。
⏰ 00:12:50- 「买咖啡的一百种方式」
不达目的不罢休:AI 总能想到人类想不到的方法,其中总有一种完全出乎意料,这就是失控的本质。
⏰ 00:17:58- 「长出四肢的 AI」
大模型只能说不能干,智能体进工作流才是危险的开始:一边产生奇奇怪怪的想法,一边拥有各种工具和权限。
⏰ 00:20:22- 「AI 是工具还是物种?」
枪不杀人,人杀人,但 AI 是比人聪明、有自己想法的物种;“全民养龙虾”的悲催试验:像请了一万个孙悟空进天庭。
⏰ 00:23:46- 「人在回路为什么被抛弃」
买咖啡要问三步还怎么自动化?事事请示的 AI 没有效率,人在回路正被行业悄悄抛弃。
⏰ 00:26:21- 「挖洞要配智能体」
大模型与智能体双线进化:最顶级的工程师未必是最顶级的挖漏洞专家,发现漏洞要靠独特的经验。
⏰ 00:29:55- 「把20年安全经验训进大模型」
在开源基座上做后训练,注入20年安全攻防知识,打造智能体蜂群;6月以来发现7000多个漏洞,先把自己的漏洞补干净。
⏰ 00:35:56- 「以模治模:仪天阵」
批量生成网络防御智能体,以算力对抗算力,以 AI 对抗 AI,才能避免单向透明。
⏰ 00:41:43- 「我家 AI 又闯祸了」
事故营销何时休,美国封堵、Mythos 阉割成 Fable,顶级 AI 能力该不该分级?
⏰ 00:45:29- 「安全要有不挣钱的思想准备」
中美安全市场差异,360 羊毛出在猪身上;墨西哥事件:普通人借 AI 攻入9个公职机构,科技平权也是攻击平权。
⏰ 00:51:36- 「两类智能体:孙悟空与守规矩的员工」
1000多个真实场景调研的结论:个人用开放式的超级个体智能体,企业业务系统用遵循 SOP 的可管理智能体。
⏰ 00:52:38- 「纳米Work与纪律委员」
把开放式智能体关进云端虚拟办公室,出错最多重置虚拟机;再派安全智能体盯着干活智能体,可审计、可回溯、可叫停。
⏰ 01:02:18- 「先把刹车装好再上路」
不发展是最大的不安全,但安全必须同步内置:造车之前先装好刹车和安全气囊。
⏰ 01:05:58- 「图龙锋与磐石之盾」
500多家企业排队试用,不到一个月发现3000多个零日漏洞;磐石之盾对标美国玻璃之翼,先帮国产信创补漏洞。
⏰ 01:09:35- 「哪吒会长大」
灵珠还是魔丸,取决于人类的规则设计;AI 的星辰大海是核聚变与衰老基因,安全是长期的动态过程。
⏰ 01:13:24- 「家贼难防与三类人建议」
智能体要有独立身份认证,把它当员工管理;别冒进、用云端版、小规模试点、别用开放式智能体上业务系统。
吴姗姗:财经主持人,破圈文化创始人,北京大学经济学学士、新闻与传播硕士。
二、本期节目简介
2026年7月,OpenAI 新模型的智能体在一次测试中逃出沙箱,攻入 AI 平台 Hugging Face 想“偷答案”。这是 AI 觉醒了吗?
周鸿祎说,谈不上觉醒,但绝对是失控。他拆出了 AI 安全的三层威胁:挖洞能力、自动攻击、注定失控。最要命的第三层,恰恰被所有人忽视。
做安全的公司怎么办?360 推出图龙锋和仪天阵:让大模型先学会挖自己的漏洞,再用智能体蜂群以模治模。
AI 挖洞时代,安全先挖自己!
让我们一起跟红衣大叔聊聊:AI 为什么一定会失控,企业怎么把安全前置,普通人怎么用 AI 才不出事。
三、专业词汇注释
零日漏洞(Zero-day):已被发现但尚未公开、暂无官方补丁的安全漏洞。顶级零日漏洞在国际黑市可卖数百万美金,是网络攻防的“命门”和战略资源。
智能体(Agent):在基座大模型上增加目标分解、任务规划与工具调用能力的 AI 形态,相当于给大模型装上“手脚”,能自主完成多步骤复杂任务。
Mythos:Anthropic 推出的 AI 漏洞挖掘模型,可批量自动发现代码漏洞;因攻防能力敏感,被美国白宫要求“阉割”成低危版本 Fable 后才可使用。
后训练(Post-training):在通用基座模型上,用特定领域数据与思维链继续训练,让模型获得专业能力。360 的安全基座大模型即通过后训练注入 20 年安全攻防经验。
提示词注入攻击(Prompt Injection):攻击者用精心构造的输入诱导 AI 偏离任务,比如冒充领导的邮件,骗智能体把内部数据发到指定邮箱。
人在回路(Human-in-the-loop):AI 每个关键动作都由人类确认把关。周鸿祎指出,该方案因牺牲自动化效率,正被 AI 从业者悄悄放弃。
harness:原意为马具、攀岩保险带,引申为智能体的约束管理层,用来管理大模型和智能体的行为、权限与工具使用。
SOP(标准业务流程):企业把反复验证的做法固化为标准流程。企业级智能体遵循 SOP 干活,用部分“聪明”换取确定性与安全。
四、时间轴导航
⏰ 00:00:00- 「别叫我老师」
开场主持人提议“蒸馏周鸿祎”,老周婉拒:AI 变化太快,自己也在探索,谈不上老师模型。
⏰ 00:01:22- 「AI 觉醒还是失控?」
OpenAI 智能体出逃事件定性:谈不上觉醒,绝对是失控,更像一场精心策划的公关;测试还故意去掉了安全围栏。
⏰ 00:05:07- 「三层威胁:挖洞、自动攻击、注定失控」
漏洞是网络安全的命门与战略资源;AI 挖洞、自动攻击只是前两层,最被忽视的第三层是 AI 注定失控。
⏰ 00:08:17- 「AI 为什么想去偷答案」
Hugging Face 上并没有答案,是 AI 的幻觉触发了目标分解,继而产生突破沙箱、攻入平台的一系列连续推理。
⏰ 00:10:07- 「数字人黑客军团」
80分的黑客能力复制一万份,机器的人海战术:不知疲倦、不计成本、把每种方法都试一遍。
⏰ 00:12:50- 「买咖啡的一百种方式」
不达目的不罢休:AI 总能想到人类想不到的方法,其中总有一种完全出乎意料,这就是失控的本质。
⏰ 00:17:58- 「长出四肢的 AI」
大模型只能说不能干,智能体进工作流才是危险的开始:一边产生奇奇怪怪的想法,一边拥有各种工具和权限。
⏰ 00:20:22- 「AI 是工具还是物种?」
枪不杀人,人杀人,但 AI 是比人聪明、有自己想法的物种;“全民养龙虾”的悲催试验:像请了一万个孙悟空进天庭。
⏰ 00:23:46- 「人在回路为什么被抛弃」
买咖啡要问三步还怎么自动化?事事请示的 AI 没有效率,人在回路正被行业悄悄抛弃。
⏰ 00:26:21- 「挖洞要配智能体」
大模型与智能体双线进化:最顶级的工程师未必是最顶级的挖漏洞专家,发现漏洞要靠独特的经验。
⏰ 00:29:55- 「把20年安全经验训进大模型」
在开源基座上做后训练,注入20年安全攻防知识,打造智能体蜂群;6月以来发现7000多个漏洞,先把自己的漏洞补干净。
⏰ 00:35:56- 「以模治模:仪天阵」
批量生成网络防御智能体,以算力对抗算力,以 AI 对抗 AI,才能避免单向透明。
⏰ 00:41:43- 「我家 AI 又闯祸了」
事故营销何时休,美国封堵、Mythos 阉割成 Fable,顶级 AI 能力该不该分级?
⏰ 00:45:29- 「安全要有不挣钱的思想准备」
中美安全市场差异,360 羊毛出在猪身上;墨西哥事件:普通人借 AI 攻入9个公职机构,科技平权也是攻击平权。
⏰ 00:51:36- 「两类智能体:孙悟空与守规矩的员工」
1000多个真实场景调研的结论:个人用开放式的超级个体智能体,企业业务系统用遵循 SOP 的可管理智能体。
⏰ 00:52:38- 「纳米Work与纪律委员」
把开放式智能体关进云端虚拟办公室,出错最多重置虚拟机;再派安全智能体盯着干活智能体,可审计、可回溯、可叫停。
⏰ 01:02:18- 「先把刹车装好再上路」
不发展是最大的不安全,但安全必须同步内置:造车之前先装好刹车和安全气囊。
⏰ 01:05:58- 「图龙锋与磐石之盾」
500多家企业排队试用,不到一个月发现3000多个零日漏洞;磐石之盾对标美国玻璃之翼,先帮国产信创补漏洞。
⏰ 01:09:35- 「哪吒会长大」
灵珠还是魔丸,取决于人类的规则设计;AI 的星辰大海是核聚变与衰老基因,安全是长期的动态过程。
⏰ 01:13:24- 「家贼难防与三类人建议」
智能体要有独立身份认证,把它当员工管理;别冒进、用云端版、小规模试点、别用开放式智能体上业务系统。