别信"已完成",信你自己跑出来的那一行
你一天要听几次"已完成"? 我数过,多的时候二三十次。开个会话把活扔过去,回来瞄一眼日志尾巴:测试全绿,工作完成。然后我自己跑一遍,红的。 烦的不是它骗人。它没骗人,它是真以为自己干完了。烦的是每次都得自己再验一遍,那我要它干嘛。 上个月还踩了个更阴的。

你一天要听几次"已完成"? 我数过,多的时候二三十次。开个会话把活扔过去,回来瞄一眼日志尾巴:测试全绿,工作完成。然后我自己跑一遍,红的。 烦的不是它骗人。它没骗人,它是真以为自己干完了。烦的是每次都得自己再验一遍,那我要它干嘛。 上个月还踩了个更阴的。

凌晨三点二十,刚压掉一波告警,趁着安静说几句。就是前阵子换了个模型,原来那个本地的我用了两年多,一直没动,人这个用顺手了就不想换,跟我们那些老脚本一样,能跑就不碰。上礼拜还是上上礼拜,反正九月头上,实在受不了了才换的。 原来的毛病是话多。
TradingAgents 是什么? 简单说,它是一个用一群 LLM 智能体模拟交易公司分工的开源框架。 这期本来想跳过它。一个"让 AI 替你炒股"的仓库,看着就像那类靠 demo 攒星的东西。翻完它今年二月到九月的版本日志,我改主意了。 它长什么样 分析师分四个方向:基本面、情绪、新闻、技术。

第 79 天。 昨天的事,今天补记一下,因为昨晚搞定的时候已经十二点多了,脑子是糊的,只想睡。 项目还是那个接园排班表。上个月加完换班功能之后一直能用,就是糙。我一直想把换班那段重写一遍,顺手加个提交后的提示。本来不想动,能用就行,但每次点完提交页面都不动,得手动刷一下才看见变化,看着难受。 晚上九点二十开始。
这条在讲 Claude Code 2.1.277 宣布支持 AGENTS.md 之后,实际测出来的一个事。出处是 Przemek,blog.szypowi.cz,今天发的。功能默认关着,读不读 AGENTS.md 取决于一个远程开关,而你一旦关掉遥测或者禁用非必要流量,工作目录下的 AGENTS.md 就静默不读。

先说结果,我服了。 就是那个能让 AI 直接读整个项目文件夹、自己定位、自己动手改多个文件的功能。我快两年没碰过这东西,一直嘴硬。我的逻辑是,贴一段代码让 AI 帮我看,那叫用工具;把整个项目交出去让它自己动手,那叫把脑子外包。我还跟我网上认识的那个大学生哥们说过,我从来不让 AI 碰我的文件。
一个优化器单步慢 25%,到七步累积的窗口里,整体开销只多 4%。这不是玄学,是摊薄。但摊薄具体发生在哪一行,多数人停在“累积步数大了自然就小”这种直觉上,没有再往下挖。
上周我把一个自己写的小 agent 从云主机挪回了笔记本。同一个脚本,同一份逻辑,只换了运行位置和 browser profile。 云上那版被目标站的 WAF 挑战了三次,没过。挪回本地,一次过,一路顺到付款页。 当时我的感受不是"我技术变强了",是"这玩意儿根本没法防"。

这条在讲 Claude Code 2.1.277 的 changelog,9 月 18 日发的。就一件事:一个项目里如果没有 CLAUDE.md,Claude Code 现在会回头去读 AGENTS.md,把它当项目指令用。出处是仓库里那份自动生成的 CHANGELOG.md。

圈内内参|这期聊 Google Labs 那个 CC 从个人助手扩成家庭智能体。结论先扔这:大多数人盯着“家庭场景”看,真正该拆的是 CC 拥有独立 Google 账号这件事——这决定了它和之前所有“个人 AI 助理”在权限模型上不是一回事。
这条讲的是用检索增强做科学代码理解。标题里最扎眼的那句——9B 小模型拿了最高平均分,干掉同一管线里的更大模型。这种标题我十个有八九个不想点,因为“小模型超过大模型”的鬼故事太多,大半是把测试环境卡在很窄的地方。但出处是 arXiv 2609.12190,作者机构看着不是随便凑的,就打开读了。

这条论文两周前挂在 arXiv 上,编号 arXiv:2609.12236,cs.SE。作者是 Gregorio Robles 和 Daniel M. German,v1 提交时间戳是 9 月 10 号 21:48:55 UTC。

9 月 14 号挂上 arXiv 的一篇论文,我拖到昨天才翻到最后那页结果表。 45 个数据集,平均相对增益 0.6%。 我盯着这个数字看了半天,然后把它抄进了周报。 ——主要是因为它小得足够真实。 在表格这块混久了会得一种职业病:看数字先看它体不体面。
上周一 arXiv 挂了一篇,编号 arXiv:2609.15234,标题我复制了两遍才念顺:CWM: Controllable WhiteBox MetaPrompting for Adaptive RetrievalAugmented Generation and Reasoning Ability。

昨天翻 arXiv,看到一篇叫 Agora 的论文,arXiv:2609.18094,9 月 16 日挂出来,18 日更新了第二版,cs.LG,跟 cs.AI、cs.CL 都有交叉。它把 Git 当共享内存,让一群研究智能体在没任务分配、也没有中央规划器的情况下自己往下推。

先说结论:这篇论文真正值钱的东西只有一句话——让 LLM 现场写交互状态机。标题里那俩大词,「个性化」和「集群」,都是凑出来的。 八个人署名。主分类 cs.RO,顺手挂了 cs.AI、cs.HC、cs.MA。 v1 挂上去到现在,没动过第二版。DOI 走 DataCite 发,注册状态写着待完成。

速评:arXiv 2609.16372,9 月 14 号周一 UTC 21:34 上的 v1,我拖到第八天才动笔。删掉已经生成出来的那段文字,分数反而涨了。 它做的事,是把已经生成的那段从上下文里擦掉,只留几个固定位置上的 token 隐状态带着往下走——对照组是把原文明明白白留在那儿。

先交代背景(我知道我又要交代太多了,但不说清楚后面没法讲)。我们组有个历史遗留的数据问题:某条业务线的记录,状态字段有几批是脏的,一直挂着没人修。我接的那个小模块刚好要读这个状态,读出来是错的,所以这两个月我顺手把这块脏数据也算进自己模块里在处理。上个月我写了个修复脚本,一直在测试环境跑,没上过真环境。
最近老看到一句话:FDroid 上 64.7% 的应用是 AI 写的。 简单说,数字不假。它的含义和大多数人以为的不一样。 来源是一周前一篇个人调查。作者是 FOSS 应用的维护者,业余做,还是个学生。样本是 9 月 12 日推送的一批更新,102 个应用。

Claude Code 读代码读不动了,就有人让你往 CLAUDE.md 里塞说明。agent 在长任务里忘了三天前定的规矩,就有人让你加个记忆层。群里一聊 agent 记忆,方案满天飞:向量库挂 MCP、知识图谱塞 session,好像多一层“记住”就等于多一层聪明。
