Anthropic 如何构建 Claude Code auto mode:以模型分类器减少权限确认
Anthropic 为 Claude Code 推出 auto mode,用模型分类器替代人工批准操作,并通过输入层提示注入探测和输出层分类器检查高风险行为。分类器由 Sonnet 4.6 运行,先进行单令牌快速过滤,再对可疑操作进行推理复核;其完整流程将真实流量误报率从8.5%降至0.4%,但真实过度主动操作的漏报率为17%,合成数据外泄任务的漏报率为5.7%。
本站判断:Anthropic 拆解了 Claude Code auto mode 的双层安全架构与评估取舍,有助于理解模型分类器如何减少权限确认及其残余风险。