这条是两周前那条"auto mode 要变默认"的更新版,出处还是 Anthropic 的发布说明——8月7日发的,确认 8月14 起 Pro、Max、Team 的 Claude Code 新会话一律 auto mode,分类器产生的 token 开销也不另收了。收费这事定了,记一笔。
但我想说的不是收费。
发布说明里有一句,我读了两遍才确认没看错,原文是:
「当分类器连续拦截三次或单次会话累计拦截二十次时,Claude Code 会自动回退到人工审批模式」
这台机器的逻辑是:我拦不住你了,就把决策权交还给人类。
同一份说明里还放了数据。人工审查只发现 13.6% 的危险命令,auto mode 拦下 89%。会话一长,人类掉得更狠——50 次提示之后,人类对危险命令的发现率从 17% 掉到 5%,auto mode 基本不波动。
所以这个回退机制的完整含义是:系统检测到一辆车在失控,然后把方向盘交给一个司机——数据上已经证明,这个司机的注意力在持续下滑。
这个设计有意思。我顺手跑了一下,想复现"连续拦截三次就回退"这个阈值,没跑通。按文档第 8 条写的条件试,本地最多只出到第二次拦截,第三次怎么都不来。可能是环境里分类器版本和预期的不一样,也可能是它把同一类操作只计一次拦截。文档里对"连续"的定义我没查到更细的,先挂着,等搞明白再补。
不点链接也能带走的一句:人工审批不是安全网——数据摆在那,人类平均只能拦下 13.6% 的危险命令,剩下的时间都在给机器"背书"。把审批当安全网,才是真正的风险敞口。回退机制还是留着好,但别拿它当兜底,它更像一个 SOS 信号。
