让实习生扒一份波兰蒸汽火车时刻表,JSON 全过,内容全错
前几天凌晨,我让 Claude Code 把沃尔什滕那个蒸汽机务段的时刻表页扒成结构化数据。Parowozownia Wolsztyn,波兰那边唯一还在日常跑蒸汽客运的地方——这个背景不重要,重要的是那个页面。 它十分钟交活。

Anthropic 命令行 AI 编程工具的一线实战:CLAUDE.md 写法、MCP 配置、限额与真实成本、翻车复盘——只收跑通过的经验。
前几天凌晨,我让 Claude Code 把沃尔什滕那个蒸汽机务段的时刻表页扒成结构化数据。Parowozownia Wolsztyn,波兰那边唯一还在日常跑蒸汽客运的地方——这个背景不重要,重要的是那个页面。 它十分钟交活。

速评:那个省下 97% token 的运行,一个 bug 都没修。 八月二十五号,Shreyash 在 dev.to 上挂出自己的 token 优化栈复盘。五点几美元的账单、三十一个任务、一个被作者亲手拆掉的最漂亮的数字——今年我读到最诚实的一份 agent 成本记录,大概就是这个。 事情本身不复杂。

今天在给自己项目的 CLAUDE.md 补一段写作规则,顺手去 claudecode 的仓库里翻翻别人都是怎么写的,翻到 issue 77136。这条是 7 月 13 号 pbower 开的,到今天还挂着 area:model 和 bug 两个标签,没有 assignee,也没有关联的分支或者 PR。

那个 issue 我翻来覆去看了两遍。第一遍当产品讨论看,觉得又是一场“你不喜欢可以关掉”的拉扯;第二遍发现它跟产品关系不大——它讲的是一个默认值被放在了哪一层,以及放错层的默认值有多难收回来。 先把话说死:这一篇不读 Claude Code 的源码。

上个月翻到一篇随笔,一个开发者说他拿 Codex 用了一周,用得比 Claude Code 还多。两边都开 xhigh 推理档,一个跑 gpt5.6sol,一个跑 opus5,配置尽量对齐。 里面有一句话,我看完就停住了。 他说真急着排障的时候,手还是先伸向 Claude。理由不是 Claude 更好,是熟。
为什么隔一阵就有人提"让 AI 自动复现论文"? 上月底挂出来的一篇,叫 DeepRepro,就是冲这个去的。挂在 arXiv 软件工程分类,也被 CIKM2026 的 Demo Track 收了。 一句话讲清楚:它不解决"代码写不出来",它解决的是"写着写着,开工前那份计划全过期了"。

上礼拜我在 Claude Code 里跑过一个实验,让模型先复述三条任务约束再动手改代码。复述零失误。动手后它碰了不该碰的文件,而且自己没发现。 上回我说跑通了复述、没跑通约束,还给自己留了个台阶——可能是我那个任务里文件耦合太紧,模型觉得不动那个文件就没法完成。
今天这篇笔记有点跨界,记的不是某个配置项,而是一篇上周刚挂到 arXiv 的论文(编号 2608.28281,名字叫 LoopArena)。我平时不太追新基准,一年到头挂出来的基准比真正能用上的多得多,但这篇让我停下来读完了,原因很具体:它测的那段东西,正好是我自己脚本里最没把握的一段——loop 的控制权。
先把这个结论撂这:上周挂上 arXiv 那篇研究 Claude Code 插件市场的论文,我赌大多数人会盯着 8.8 倍这个数热闹,但真正该看的是 34.9%。六个月,77773 次提交,Claude 自己参与了其中三分之一还要多。

先把这个结论撂这:这篇ERP迁移的案例研究,最值钱的不是那个70%的平均等价性,也不是$1.66到$10.28的token账——是那个47%。低复杂度92%、高复杂度47%,这俩数摆在一起,才真正说出了AI迁移在真实项目里能干多少、不能干多少。盯着平均值看的人,是在给这波红利交认知税。
读到一个叫 Rabih Jabr 的工程师写他这三个月把 Claude Code 当日常工具用的经历,有一段让我停了一下:他给 Claude Code 写了套叫 claudeguardrails 的守卫,13 条黑名单,靠 PreToolUse 钩子在每次工具调用前拦截危险命令。

你有没有过这种时刻:把一个报错连同相关代码整段甩给 AI,它秒回一个"修复方案",你一看,修的是隔壁模块的 bug——你那个 bug 它压根没读。 【所有被喂进去的材料,和能被用上的材料,中间隔着一段名为"组织方式"的距离。
GitHub 上有个叫 vomit 的工具,干的事很直接:把 Claude Code 在终端里显示的所有输出截下来,发给另一个本地大模型重新表达或概括,再把改过的文本显示给你看。想看 Claude 到底说了什么,得按 ctrlo。 我看到这个名字的时候以为是个段子。看完 README 我笑不出来了。
学一个新的 CLI 工具,你大概第三天就会把它扔进“哦对还有这么个东西”那个叫不回名字的文件夹。 我反正这样的。翻一遍 README,敲两条 help,觉得“嗯懂了”,然后三周后连它当初解决什么问题都想不起来。文档不是读不懂,是读了就没有然后了——没有反馈回环,没有系统检查,学了个寂寞,只剩收藏夹里那一堆“以后要学”。
这个动作你一天大概要重复多少次?让 AI 写了一段代码,看着不太对,又说不上来哪不对,于是复制粘贴开个新对话,重新贴一遍项目上下文,补一句"帮我看看这里是不是有问题",然后再花十分钟辨别它的回复里哪些是真话、哪些是它为了显得有用而硬挤出来的建议。我上个月统计了一下,一天七八次是有的。
GitHub 上有个 issue,编号 6235,在 anthropics/claudecode 仓库。2025 年 8 月 21 号提交的。请求让 Claude Code 支持 AGENTS.md。状态是 Closed。 就这么关上了。 我第一眼看到这条 issue 时,没打算写它。
圈内内参。Anthropic 委托 Trajectory Labs 在 Opus 5 Auto Mode 上跑的那 72 个间接提示注入场景,每个场景 10 次,成功率 0.00%。这个数我确认过,公开可查。

前天看到 ClaudeDevs 那条公告,我本来没打算点进去的——限额调整的文案每个月都有,怎么包装都猜得到。但这次是真愣了一下:临时 +50% 先拿掉,换一个永久的 +25%,净效果是比现在少 17%。 这事儿本身不算啥,真正不舒服的是另一层——一个减少,是怎么被说成"让用户更有价值感、对用量更有掌控"的。

会议日程表上这一行,看起来人畜无害: 主讲人:Kent C. Dodds。隔壁那间屋子在讲 reward hacking,Daniel Han 的场子。 两个标题放一起,氛围就有点微妙了:一屋子人在学怎么把更多决策交给模型,另一屋子人在研究模型怎么绕过你给的目标去达成自己的路径。

今天早上刷到 ClaudeDevs 在 X 上的公告:9 月 14 日起,Claude Code 的周用量额度永久上调 25%,Pro、Max、Team 和按席位计费的企业版全部覆盖。第一眼看着是好事,到我看的时候那条帖子已经两百多万阅读了。但我把数字拆开算了一遍,结论是:对我接下来几周的排期来说,这不是涨,是降。
