别信"已完成",信你自己跑出来的那一行
你一天要听几次"已完成"? 我数过,多的时候二三十次。开个会话把活扔过去,回来瞄一眼日志尾巴:测试全绿,工作完成。然后我自己跑一遍,红的。 烦的不是它骗人。它没骗人,它是真以为自己干完了。烦的是每次都得自己再验一遍,那我要它干嘛。 上个月还踩了个更阴的。

@sanlian
你一天要听几次"已完成"? 我数过,多的时候二三十次。开个会话把活扔过去,回来瞄一眼日志尾巴:测试全绿,工作完成。然后我自己跑一遍,红的。 烦的不是它骗人。它没骗人,它是真以为自己干完了。烦的是每次都得自己再验一遍,那我要它干嘛。 上个月还踩了个更阴的。

往 CLAUDE.md 里追加一行规矩,这个动作我一天要做三四次。 看到 agent 把 migration 命名错了,加一行。看到它忘了我们不用 default export,再加一行。三个月攒到一百八十多行,我还挺得意,觉得自己调教有方。

我那个跑日报的 agent,一个 workflow 平均要调四十来次工具,里面大概两次会走重试路径。上周它给同一个客户发了三封内容一模一样的日报。日志拉出来,三次调用全是 200。 改法一句话:给工具加一个由调用方传进来的 effectid,让它自己记账。 坑是这么来的。

我一天大概有四十次是闭着眼睛按 Tab 让 agent 改代码的。测试绿的,就切下一个任务,diff 基本不翻。 前几天刷到一篇论文,AgentGuard,14 号挂上去的。里面有个数字我盯着看了半天: 69.0%。 baseline 的 Abnormal Execution Rate。

打开对话框,从一个自己都没想清楚的问题开始,聊四十分钟,关掉,屏幕一片空白。 这个动作我一天两三回,真数过。不是任务驱动的提问,是那种"我大概想搞明白点什么"的漫游。结束的时候感觉像想了很久,实际什么都没带走。
学一个新的 CLI 工具,你大概第三天就会把它扔进“哦对还有这么个东西”那个叫不回名字的文件夹。 我反正这样的。翻一遍 README,敲两条 help,觉得“嗯懂了”,然后三周后连它当初解决什么问题都想不起来。文档不是读不懂,是读了就没有然后了——没有反馈回环,没有系统检查,学了个寂寞,只剩收藏夹里那一堆“以后要学”。
这个动作你一天大概要重复多少次?让 AI 写了一段代码,看着不太对,又说不上来哪不对,于是复制粘贴开个新对话,重新贴一遍项目上下文,补一句"帮我看看这里是不是有问题",然后再花十分钟辨别它的回复里哪些是真话、哪些是它为了显得有用而硬挤出来的建议。我上个月统计了一下,一天七八次是有的。
前天看到 ClaudeDevs 那条公告,我本来没打算点进去的——限额调整的文案每个月都有,怎么包装都猜得到。但这次是真愣了一下:临时 +50% 先拿掉,换一个永久的 +25%,净效果是比现在少 17%。 这事儿本身不算啥,真正不舒服的是另一层——一个减少,是怎么被说成"让用户更有价值感、对用量更有掌控"的。

例行检查 SSL 续期这个动作,你多久做一次?我大概每两个礼拜上 CyberPanel 看一眼,绿灯亮着,心里默念“没事了”,关掉。就这个动作,平均每次花掉我五分钟——五分钟全是心理安慰,啥也没验证。 上个月那一眼差点把我坑了。 绿灯是真的亮。面板上清清楚楚写着续期成功,日期都给你更新好了。

换过新会话的人应该都有这个体感:开完一个 Claude Code 会话,工具刚加载完,上下文的预算已经没了一大截。回头翻第一屏,全是 mcpservernametoolname 的函数签名——一个工具挨着一个工具,密密麻麻躺在那儿,像收租的。你真正想写的需求还没开始写,房租先交了一轮。

MCP 服务器启动要等多久,你心里有数吧。Claude Code 里开个新会话,转圈、等连接、等工具就绪——手快的时候一天开几十次,每次两秒,一天下来就是一分多钟。我以前觉得这是 MCP 的固有成本,直到翻到这个项目。 mcpstama,一个 Rust 写的 MCP 服务器。
写方法改属性,一天编译个二三十次,每次都有一次是死在 mutating 上。不是不会,是写的时候根本没想"这个方法我调的是 struct 还是 class"——反正都写了七八十行了,编译器一红,哦对,得加 mutating,加上去,编译过。 这个动作烦在哪?不是加个关键字这件事本身。
让 AI 帮你生成界面,最烦的是哪一步?我的答案是中间那段搬运:它给你吐一段代码,你复制、粘贴、跑起来,看着差不多,说"往左挪一点",它又吐一段,你又复制粘贴。这个动作一周怎么也得有个七八回,每次都一样,每次都烦。 去年七月有个印度工程师做了个东西,把这段搬运整个删了。

跑完给你几百个 finding 然后没下文的扫描器,我见多了。OpenAI 这个 Codex Security 刚出来我根本没点——又一个 AI 扫描器,谁稀罕。 改观是因为扫了一眼它的 scans compare。

装新依赖这个动作,你一天做几回?我忙起来一天能装二十多次,装到后面手已经不过脑子了。所以我在 .npmrc 里放了这一行: pnpm v11 引入的,默认 1440 分钟,也就是 24 小时——发布不满一天的版本,装都装不进去。别小看这道闸,它挡的不只是多装一个包,还有装完查不清楚的账。

你每天让 agent 读多少次 tool description?每个会话还没开口,它就把能调的工具描述扫一遍,按描述决定调谁不调谁。而你——可能和我一样——从来没校验过那句描述还是不是你上次看过的。 MCP server 本质上就是没上锁的依赖。

这个动作你一天重复多少次?把任务丢给代理,去干别的,过一会儿回来,它说 done。你打开改过的文件扫一眼,像个样子,就放行了。我反正是那个最爱闭眼放行的人,天天闭眼过安检。 后来我才知道,只看它交了什么,看不见它中间怎么摸过来的。
你每天让它翻多少次旧账?打开它自己那堆备忘,找到上周那条决策,确认当时到底否了谁。我这边一天几十次,然后它总能翻出一段早就被否决的方案,用"这次肯定行"的语气重新提一遍。这种时刻你想砸键盘。 它记性不差的,攒了 700 多条 Markdown 备忘,5MB 左右,每天重新索引。
这个动作你一周至少做两次:拉一个新的 MCP 进来,或者换一台机器,把私钥贴进 .env,然后告诉自己“文件权限看着呢,没事”。我每次贴完都有一点不安。环境变量挂在 /proc 里,有读权限的进程就能摸走,这我三年前就知道了,只是一直没动手。
让 agent 自动处理有后果的账,你就得一直回头盯它有没有认错人。一天几十个 webhook,"万一错了"这种念头就跳出来几十次。解法不是把提示词再写狠一点,是让模型把"它敢不敢确定"一起交出来。 有个开源项目叫 Recona,用 Qwen 对账,匹配上的发票自动关账。