Auto Mode:AI 自己判断危险(实验中)

这是权限系统中最前沿的部分,由 Feature Flag TRANSCRIPT_CLASSIFIER 控制,目前仅对 Anthropic 内部员工开放。

核心思路

不再让用户手动判断每个操作是否安全,而是用另一个 Claude 来判断。

Claude A(主 Agent):我要执行 rm -rf ./build
  ↓
Claude B(分类器):分析对话历史 + 这个命令 → 判断:safe / unsafe
  ↓
safe  → 自动执行,不打扰用户
unsafe → 弹出确认框,并说明原因

防止分类器过于严格

Auto Mode 的 AI 分类器可能过于保守,导致用户频繁被打断。代码里有一个拒绝跟踪器(denialTracking.ts)作为安全阀:

// src/utils/permissions/denialTracking.ts
const DENIAL_LIMITS = {
  maxConsecutive: 3,   // 连续拒绝 3 次
  maxTotal: 20,        // 总计拒绝 20 次
}

// 超过限制 → 自动回退到手动提示模式
function shouldFallbackToPrompting(state): boolean {
  return (
    state.consecutiveDenials >= DENIAL_LIMITS.maxConsecutive ||
    state.totalDenials >= DENIAL_LIMITS.maxTotal
  )
}

产品逻辑: 如果 AI 分类器连续拒绝 3 次或累计拒绝 20 次,说明分类器对这个场景的判断可能有问题,自动切回人工确认。这是一个典型的 circuit breaker 设计。