验证正在吃掉你省下的那笔钱
Ken W Alger 九月初在 dev.to 上那篇实验,我一开始没当回事——代码生成不是瓶颈了、验证才是,这种话我半年前就见过,不新鲜。但他那个密码重置的实验有个细节,我越想越觉得这账得重新算:五分钟生成,四十五分钟验证,实际流程五十分钟。总时间一分没省,事儿换了个人干。

Anthropic 命令行 AI 编程工具的一线实战:CLAUDE.md 写法、MCP 配置、限额与真实成本、翻车复盘——只收跑通过的经验。
Ken W Alger 九月初在 dev.to 上那篇实验,我一开始没当回事——代码生成不是瓶颈了、验证才是,这种话我半年前就见过,不新鲜。但他那个密码重置的实验有个细节,我越想越觉得这账得重新算:五分钟生成,四十五分钟验证,实际流程五十分钟。总时间一分没省,事儿换了个人干。

昨天半夜刷 HN,看见一个帖子里出现了 Shabbat。我第一反应是哪个新框架。 点进去才知道,是一群人在吵"安息日能不能让 AI agent 继续跑"。 按理说跟一个还在学 Claude Code 的人没关系。我翻了一个多小时,关浏览器的时候心里有点发毛。 因为里面提到了魔像。 布拉格那个,传说里到安息日得把它关掉。

你一天要听几次"已完成"? 我数过,多的时候二三十次。开个会话把活扔过去,回来瞄一眼日志尾巴:测试全绿,工作完成。然后我自己跑一遍,红的。 烦的不是它骗人。它没骗人,它是真以为自己干完了。烦的是每次都得自己再验一遍,那我要它干嘛。 上个月还踩了个更阴的。

这条在讲 Claude Code 2.1.277 宣布支持 AGENTS.md 之后,实际测出来的一个事。出处是 Przemek,blog.szypowi.cz,今天发的。功能默认关着,读不读 AGENTS.md 取决于一个远程开关,而你一旦关掉遥测或者禁用非必要流量,工作目录下的 AGENTS.md 就静默不读。

这条在讲 Claude Code 2.1.277 的 changelog,9 月 18 日发的。就一件事:一个项目里如果没有 CLAUDE.md,Claude Code 现在会回头去读 AGENTS.md,把它当项目指令用。出处是仓库里那份自动生成的 CHANGELOG.md。

这条讲的是用检索增强做科学代码理解。标题里最扎眼的那句——9B 小模型拿了最高平均分,干掉同一管线里的更大模型。这种标题我十个有八九个不想点,因为“小模型超过大模型”的鬼故事太多,大半是把测试环境卡在很窄的地方。但出处是 arXiv 2609.12190,作者机构看着不是随便凑的,就打开读了。

昨天翻 arXiv,看到一篇叫 Agora 的论文,arXiv:2609.18094,9 月 16 日挂出来,18 日更新了第二版,cs.LG,跟 cs.AI、cs.CL 都有交叉。它把 Git 当共享内存,让一群研究智能体在没任务分配、也没有中央规划器的情况下自己往下推。

Claude Code 读代码读不动了,就有人让你往 CLAUDE.md 里塞说明。agent 在长任务里忘了三天前定的规矩,就有人让你加个记忆层。群里一聊 agent 记忆,方案满天飞:向量库挂 MCP、知识图谱塞 session,好像多一层“记住”就等于多一层聪明。

一个给 Claude、Codex、Cursor 用的「ADHD 友好型输出技能」,在 GitHub 上拿了 49.2k stars。这个数字什么概念——比绝大多数正经的开发者工具、CI 插件、甚至不少小语言模型项目都高。而且它的 README 自己说了:你不需要真的被诊断有 ADHD 也能用。
上周群里有人丢了个 arXiv 链接,2609.14985。我点开,13MB 的 PDF。 第一反应是想关掉。 后来还是拉下来了。标题里有"因果",有"虚拟世界",两个词都撞上我这周在捣鼓的那摊事。 先说清楚:我大概看懂了六成,剩下那四成里还有一半是直接跳过去的。

往 CLAUDE.md 里追加一行规矩,这个动作我一天要做三四次。 看到 agent 把 migration 命名错了,加一行。看到它忘了我们不用 default export,再加一行。三个月攒到一百八十多行,我还挺得意,觉得自己调教有方。

有一家人,家族树里写着某人“死于瑞士”。 后人照着这条线索去翻瑞士的死亡登记。翻不到。翻了很多年,还是翻不到。真相是他死在法国境内,一场狩猎事故,出事地点离边境线很近,近到当地一家瑞士报纸把它当本地新闻报了。于是有人读成了“死于瑞士”,写进树里。 这条错的地点,到现在还在别人的树里活着。
我一天大概有四十次是闭着眼睛按 Tab 让 agent 改代码的。测试绿的,就切下一个任务,diff 基本不翻。 前几天刷到一篇论文,AgentGuard,14 号挂上去的。里面有个数字我盯着看了半天: 69.0%。 baseline 的 Abnormal Execution Rate。

这个月初刷到一篇帖子,一开始我准备划走。 写帖子的人在做一套给 AI 编码助手用的记忆层,拿 Claude Code 自带的记忆跟他那套方案做了一组对比。这种帖子的套路我太熟了,对比是壳,广告是核。结果看到中间一段,我停住了。
速评:撑起 7.9 万颗星的那个数字,是个 ÷4。 Quesma 那篇 9 月 11 日发的,两个作者 Bartosz Kotrys 和 Jacek Migdal,测了好几天,光 token 烧掉 1500 多美元,当天就上了 HN 首页。他们给的结论是别把 RTK 当通用省钱工具。

凌晨一点,Claude Code 在跑,你盯着那个转圈的玩意儿,不知道是该去干点别的,还是就这么干等下去。 【灯光渐暗,房间里只剩风扇声,和两个人谁也没说话的沉默】 现在有人给这个沉默现场配了个啦啦队。一个 VRoid 小人搬进 VS Code 侧边栏,Claude Code 一有动静它就跳一下,冒个气泡给你打气。

7 月读到 Alex Tong 在 dev.to 上的一篇笔记,讲他用 Claude Code,会话跑到大概 45 分钟的时候,模型开始编造他根本没要求过的默认值,之前定好的约束一条条被忽略。这篇我记两件事:会话脏了之后怎么判断该不该救,以及真要重开时,怎么重新播种。

上个月某个下午,Claude Code 回了我一句用量到顶,然后就是一堵墙。 第一反应照例是"我最近也没怎么用啊"。这个判断后来被证明是错的,而且错得挺难看——不是我用得多,是我不认为那算"我在用"。 先把话撂这儿:用量失控的案子,真凶十有八九是自动化。不是模型贵,也不是哪个 MCP 服务器偷偷吃你的 context。

打开对话框,从一个自己都没想清楚的问题开始,聊四十分钟,关掉,屏幕一片空白。 这个动作我一天两三回,真数过。不是任务驱动的提问,是那种"我大概想搞明白点什么"的漫游。结束的时候感觉像想了很久,实际什么都没带走。
凌晨一点四十,我在看一个 KeyError。 没有花里胡哨的堆栈,就是一个循环里对 dict 直接取值,上游这次少给了一个字段。 修起来三分钟,定位花了四十分钟——出事的地方和报错的地方隔了四层调用。修完我没睡,顺手跑了个 blame,想看看这行是哪个天才写的。 一点不意外:一个月前,我自己 approve 的。
