主播
节目简介
来源:小宇宙
“YOLO 分类器 —— AI 审核 AI 的安全决策系统”。这一章深入解析了 Claude Code 在 auto 权限模式下,如何通过引入第二个 AI 实例作为“安全裁判”,在无人值守的情况下平衡执行效率与系统安全。
以下是该章节核心内容的总结:
1. 核心定位:AI 审核 AI
当权限模式设为 auto 时,系统不再弹出用户确认对话框,而是发起一次独立的侧查询(Side Query),由另一个 AI 模型来裁决当前操作是否安全。
* 设计目标:让 Agent 在保持自主性的同时,能区分“正常的构建清理”与“灾难性的删库操作”。
* 物理隔离:分类器拥有独立的系统提示词、消息序列和 Token 预算,确保主循环中潜在的恶意注入不会通过 API 状态影响安全裁决。
2. 分层短路过滤机制
为了降低延迟和成本,系统设计了两层零成本过滤:
* 安全白名单:所有只读操作(文件读取、搜索、LSP 查询)天然放行,不触发 API 调用。
* 字段级过滤 (toAutoClassifierInput):工具开发者可以精确控制哪些参数需要送审,如果该方法返回空,则直接放行。
3. 二阶段 XML 分类器
系统在速度与准确性之间通过两阶段架构取得平衡:
* 阶段 1:快速判定(Fast):使用极小的 Token 预算(64 tokens)和简洁的 XML 格式(yes/no )。如果是明显的安全操作,亚秒级放行,主循环几乎感知不到延迟。
* 阶段 2:深度推理(Thinking):如果阶段 1 判定为阻止或模糊,则升级到阶段 2。使用大预算(4096 tokens)并强制模型先输出 推理块。这种**链式思考(CoT)**能显著纠正阶段 1 的误判。
4. 防御性对话转录
分类器看到的不是原始对话,而是经过**投影(Projection)**后的压缩转录:
* 屏蔽助手文本:只保留 tool_use 块,完全过滤掉助手的自由文本输出。这是关键的安全设计,防止恶意注入通过 Agent 的回复来欺骗分类器。
* 配置注入:分类器能看到用户的 CLAUDE.md,从而理解项目特定的意图(如“使用 make clean 是正常的”)。
5. 拒绝追踪(Denial Tracking)与熔断
为了防止 Agent 陷入“被拒 -> 换个说法再试 -> 又被拒”的死循环,系统引入了计数器:
* 回退门槛:连续 3 次被拒或总计 20 次被拒时,系统会强制从 auto 模式回退到人工确认模式。
* 非对称重置:成功的操作会重置“连续计数”,但不会重置“总计数”,确保频繁触碰安全边界的 Agent 无法通过穿插简单操作来“洗白”信用记录。
6. 安全哲学:失败即阻止(Fail-Closed)
分类器遵循最保守的安全原则:任何不确定性都等同于阻止。
* 无论是因为 Schema 解析失败、API 超时、Token 过长还是分类器模型不可用,系统一律返回 shouldBlock: true,并将裁决权交还给人类。
在最新版本中,YOLO 分类器已从内部实验功能转变为 SDK 公开 API,标志着其准确度已达到生产级应用水平。
总结而言:本章展示了如何构建一个纵深防御的自动化安全体系。通过分层短路、二阶段验证和严格的转录投影,Claude Code 成功地将 AI 的自主权力锁在了安全栅栏之内。
以下是该章节核心内容的总结:
1. 核心定位:AI 审核 AI
当权限模式设为 auto 时,系统不再弹出用户确认对话框,而是发起一次独立的侧查询(Side Query),由另一个 AI 模型来裁决当前操作是否安全。
* 设计目标:让 Agent 在保持自主性的同时,能区分“正常的构建清理”与“灾难性的删库操作”。
* 物理隔离:分类器拥有独立的系统提示词、消息序列和 Token 预算,确保主循环中潜在的恶意注入不会通过 API 状态影响安全裁决。
2. 分层短路过滤机制
为了降低延迟和成本,系统设计了两层零成本过滤:
* 安全白名单:所有只读操作(文件读取、搜索、LSP 查询)天然放行,不触发 API 调用。
* 字段级过滤 (toAutoClassifierInput):工具开发者可以精确控制哪些参数需要送审,如果该方法返回空,则直接放行。
3. 二阶段 XML 分类器
系统在速度与准确性之间通过两阶段架构取得平衡:
* 阶段 1:快速判定(Fast):使用极小的 Token 预算(64 tokens)和简洁的 XML 格式(
* 阶段 2:深度推理(Thinking):如果阶段 1 判定为阻止或模糊,则升级到阶段 2。使用大预算(4096 tokens)并强制模型先输出
4. 防御性对话转录
分类器看到的不是原始对话,而是经过**投影(Projection)**后的压缩转录:
* 屏蔽助手文本:只保留 tool_use 块,完全过滤掉助手的自由文本输出。这是关键的安全设计,防止恶意注入通过 Agent 的回复来欺骗分类器。
* 配置注入:分类器能看到用户的 CLAUDE.md,从而理解项目特定的意图(如“使用 make clean 是正常的”)。
5. 拒绝追踪(Denial Tracking)与熔断
为了防止 Agent 陷入“被拒 -> 换个说法再试 -> 又被拒”的死循环,系统引入了计数器:
* 回退门槛:连续 3 次被拒或总计 20 次被拒时,系统会强制从 auto 模式回退到人工确认模式。
* 非对称重置:成功的操作会重置“连续计数”,但不会重置“总计数”,确保频繁触碰安全边界的 Agent 无法通过穿插简单操作来“洗白”信用记录。
6. 安全哲学:失败即阻止(Fail-Closed)
分类器遵循最保守的安全原则:任何不确定性都等同于阻止。
* 无论是因为 Schema 解析失败、API 超时、Token 过长还是分类器模型不可用,系统一律返回 shouldBlock: true,并将裁决权交还给人类。
在最新版本中,YOLO 分类器已从内部实验功能转变为 SDK 公开 API,标志着其准确度已达到生产级应用水平。
总结而言:本章展示了如何构建一个纵深防御的自动化安全体系。通过分层短路、二阶段验证和严格的转录投影,Claude Code 成功地将 AI 的自主权力锁在了安全栅栏之内。