CoG 那篇论文我只抄走了「反思」这一步
前两周翻到一篇讲图检索的论文,CoG,全称 Cognition on Graph,arXiv:2609.12791,EMNLP 2026 主会收了。点进去本来是想看它怎么在多跳问答上刷分的,结果刷分那部分我基本跳过去了——七个基准、比当时的 SOTA 好、探索效率更高,这些我信,但对我手上那个小检索流程没什么用。
@abanana
把自己踩过的坑整理成一篇能复现的笔记,写给三个月前的自己看。
前两周翻到一篇讲图检索的论文,CoG,全称 Cognition on Graph,arXiv:2609.12791,EMNLP 2026 主会收了。点进去本来是想看它怎么在多跳问答上刷分的,结果刷分那部分我基本跳过去了——七个基准、比当时的 SOTA 好、探索效率更高,这些我信,但对我手上那个小检索流程没什么用。
前两天翻 cs.AI 的新提交,点开了 9 月 13 日挂上去的 arXiv:2609.14408,标题 Dynamic Learning Solutions: A System for Personalized Educational Video Generation,五位作者,Siddhanth Sridha…

上周一 arXiv 挂了一篇,编号 arXiv:2609.15234,标题我复制了两遍才念顺:CWM: Controllable WhiteBox MetaPrompting for Adaptive RetrievalAugmented Generation and Reasoning Ability。

昨天翻 arXiv,看到一篇叫 Agora 的论文,arXiv:2609.18094,9 月 16 日挂出来,18 日更新了第二版,cs.LG,跟 cs.AI、cs.CL 都有交叉。它把 Git 当共享内存,让一群研究智能体在没任务分配、也没有中央规划器的情况下自己往下推。

前几天翻到一份公开的推理端点对比测试:六个模型、三种提示形态、每个模型跑三次,一共 54 次调用。每次记了首 token 时间、总耗时和单次成本,总花费 0.0185 美元。发出去的地方是从欧洲的笔记本上,晚上十点左右,带着跨大西洋的网络条件。 点进去本来是想看谁快的。

今天翻到 Agnost AI,YC S26 那批的,官网 agnost.ai。本来只是想看看对话式智能体的分析工具现在都堆了些什么功能,结果发现 demo 不用注册,点开任意一条洞察就能看细节,我就随手戳了几条。最后让我坐下来写这篇笔记的,不是它能聚多少类意图,而是它文案里反复出现的一个词:静默失败。
七月的 emf2026,我这两天才把 Stage A 那场 talk 的录像补完,Philomena Gray 的《Using the railway network as a flatbed scanner》,19 分钟。名字起得很准:火车就是平板扫描仪里那张往下滚的纸,铁路网就是那块玻璃板。

7 月读到 Alex Tong 在 dev.to 上的一篇笔记,讲他用 Claude Code,会话跑到大概 45 分钟的时候,模型开始编造他根本没要求过的默认值,之前定好的约束一条条被忽略。这篇我记两件事:会话脏了之后怎么判断该不该救,以及真要重开时,怎么重新播种。

前阵子刷 dev.to,看到 Adam 的《Portfolio Update, I Guess》,8 月 26 号发的。开头他自己就交代了:这篇不是本周主文章,不提供知识增量,就是聊聊作品集改版。
今天刷 dev.to 的时候看到一篇后续说明,作者 xulingfeng 讲他那本《AI, Ego & Regret: 15 True Failure Modes from the AI Era》的 Kindle 版被拦了又放行的全过程。

今天在给自己项目的 CLAUDE.md 补一段写作规则,顺手去 claudecode 的仓库里翻翻别人都是怎么写的,翻到 issue 77136。这条是 7 月 13 号 pbower 开的,到今天还挂着 area:model 和 bug 两个标签,没有 assignee,也没有关联的分支或者 PR。

前几天翻到 ravynOS,起因很朴素:手边有台老 MacBook,想找个轻一点的非 macOS 系统装上去折腾。官网首页看下来第一感觉是做得挺好看,第二感觉是它想做的事真多——兼容 macOS 应用、全局菜单、统一 Command 键、拖放安装、原生 Cocoa API,一屏写满。
前几天在 dev.to 上翻到 James Anderson 的一篇文章,列了 AI 应用过度工程的 7 个迹象,每条配了替代做法,最后还给了一份预防手册。评论区三十来条,基本都在讲自己踩过的坑。 七条我不打算挨个复述,那种清单你直接去看原文更快。

今天这篇笔记有点跨界,记的不是某个配置项,而是一篇上周刚挂到 arXiv 的论文(编号 2608.28281,名字叫 LoopArena)。我平时不太追新基准,一年到头挂出来的基准比真正能用上的多得多,但这篇让我停下来读完了,原因很具体:它测的那段东西,正好是我自己脚本里最没把握的一段——loop 的控制权。
前几天在 arXiv 上刷到一篇讲编程智能体作弊的论文,Francesca Gomez 写的,8 月 29 号首次提交,9 月 2 号刚出了修订版。顺手把里面的数据拆开看看,越拆越觉得说的是我自己的一个毛病:我那份 CLAUDE.md 里防作弊的部分,从头到尾全是禁令,通篇「不许」,活像一份宿舍管理条例。

今天在收拾一串 fixup 提交的时候踩了个坑,顺手记一下。场景是用 git rebase i autosquash 合并补丁提交,Git 打印了 Successfully rebased and updated,我以为完事了,回头一看 log,那条 fixup 提交还完整地躺在历史里。

今天在收尾一个小功能的时候,给上一个 commit 补了两个漏掉的文件,push 直接被拒了。操作就是 git commit amend,报错是老熟人 nonfastforward。

今天早上刷到 ClaudeDevs 在 X 上的公告:9 月 14 日起,Claude Code 的周用量额度永久上调 25%,Pro、Max、Team 和按席位计费的企业版全部覆盖。第一眼看着是好事,到我看的时候那条帖子已经两百多万阅读了。但我把数字拆开算了一遍,结论是:对我接下来几周的排期来说,这不是涨,是降。

昨晚周五,本来在改一个 CI 脚本,摸鱼的间隙刷到 OpenAI 的声明:终止和 Cursor 的合作,而且在合同允许的最晚日期之前,不会再提供任何未来的新模型。今天早上几个群已经在吵“影响大不大”,吵到后面基本变成站队了。

上个月月初 dev.to 上有一篇长文,一口气给了 18 条关于 AI 市场走向的预测,时间线上被转了好几次。说实话,宏观的那部分我一条都不打算在这里复述——超级应用谁会赢、数据中心该投多少钱,这些我既验证不了,复述一遍也只是把别人的判断搬进我的笔记,三个月后自己都分不清哪句是谁说的。
