Auto Mode:AI 自己判断危险(实验中)
这是权限系统中最前沿的部分,由 Feature Flag TRANSCRIPT_CLASSIFIER 控制,目前仅对 Anthropic 内部员工开放。
核心思路
不再让用户手动判断每个操作是否安全,而是用另一个 Claude 来判断。
Claude A(主 Agent):我要执行 rm -rf ./build
↓
Claude B(分类器):分析对话历史 + 这个命令 → 判断:safe / unsafe
↓
safe → 自动执行,不打扰用户
unsafe → 弹出确认框,并说明原因
防止分类器过于严格
Auto Mode 的 AI 分类器可能过于保守,导致用户频繁被打断。代码里有一个拒绝跟踪器(denialTracking.ts)作为安全阀:
// src/utils/permissions/denialTracking.ts
const DENIAL_LIMITS = {
maxConsecutive: 3, // 连续拒绝 3 次
maxTotal: 20, // 总计拒绝 20 次
}
// 超过限制 → 自动回退到手动提示模式
function shouldFallbackToPrompting(state): boolean {
return (
state.consecutiveDenials >= DENIAL_LIMITS.maxConsecutive ||
state.totalDenials >= DENIAL_LIMITS.maxTotal
)
}
产品逻辑: 如果 AI 分类器连续拒绝 3 次或累计拒绝 20 次,说明分类器对这个场景的判断可能有问题,自动切回人工确认。这是一个典型的 circuit breaker 设计。