问责不是模型的属性,这话值班表上早写着了
九月十三号晚上刷到这篇,arXiv:2609.14592,Kantarcioglu 的 vision paper,之前在亚特兰大那场 ACM AI Summit 26 上讲过一轮。标题里有个词:Accountable。 我第一反应不是"这方向不错",是——这不就是值班表上那点破事,终于有人给它起了个正经名字。
过去 7 天:133 篇新文章 · 37 位作者在更新。按读者互动加权排序。
九月十三号晚上刷到这篇,arXiv:2609.14592,Kantarcioglu 的 vision paper,之前在亚特兰大那场 ACM AI Summit 26 上讲过一轮。标题里有个词:Accountable。 我第一反应不是"这方向不错",是——这不就是值班表上那点破事,终于有人给它起了个正经名字。
群里天天有人吹某某新模型,什么榜单第一、上下文多少多少万。要我说,榜单这东西跟业务跑不跑得动是两码事,当年我们看 TPC 排名也是这么看的,跑分第一,上了生产照样趴窝。所以一开始我没换,旧的用了小半年,顺手了,干嘛折腾。 后来是被逼的。 上个月月底,对账跑批出事。
上周四下午三点,我第六次打开 amount 那个文件,组长从隔壁工位探过头来问我装了没。我说没。他说你装吧,我求你了。 老项目的这个字段,数据库里存的是分,前端要显示成元。没有统一的 format 函数,全散在四十来个文件里,写法一个赛一个地不同,有的 toFixed 有的没有,有的中间还插了一道汇率。
前几天晚上我又在调一个跑 agent 编程的部署。单纯想让它单用户响应快一点,就把 batch size 从 16 压到 4。烧起来,单流测试里 token 间隔从 170ms 降到 90ms 出头,看着确实快了。可同一张卡,一小时能喂饱的并发请求从两百多个掉到四十几个。

Claude Code 读代码读不动了,就有人让你往 CLAUDE.md 里塞说明。agent 在长任务里忘了三天前定的规矩,就有人让你加个记忆层。群里一聊 agent 记忆,方案满天飞:向量库挂 MCP、知识图谱塞 session,好像多一层“记住”就等于多一层聪明。

9 月 13 号,凌晨一点多,我在 arXiv 上刷到一篇新东西。标题很直白——Not All Agents Are Equal,五个商业编码 agent 的代码质量和合并后维护。37,623 个 PR,2,807 个仓库。9 页,5 张图 2 张表。 我没读正文,直接翻到有数的那一页。

上周有人在群里甩了个 arXiv 链接,2609.13771,Homeostatic Continual Learning,9 月 12 号挂上去的。18 页,12 张图,1 张表。图比一般论文密,看得出来作者是真想把机制画清楚。 我点开它的时候,正在改自己那个 agent 的记忆层,改得一肚子火。

速评:这篇论文最该转的不是结论,是它自己招了在哪塌。 9月15号挂 arXiv 的 cs.AI 分类,9月16号出第二版,隔一天。14页正文配1张图。这个配置本身就有信息量——那些判断不是图跑出来的,是人一条条读答案读出来的。一天之内改了啥我没比对,不猜,可能是作者信息也可能是补表,不知道的事不编。
9 月 13 号挂上 arXiv 的 TriCalRAG,编号 2609.14762。标题里那个"基准"我没兴趣,戳我的是中间一段结果描述: zeroshot 下,两个开放权重模型基本退化,某些数据集上,把 100% 的事件都判成 anomaly。 一条不漏地报警,等于一条都没报。

$N 是从一张 1999 年的证书里读出来的模数,t 32 是线程数。剩下的事交给机器自己跑。 有人真这么干了。Matthew McPherrin 把 Netscape 4.51 里那两张 512 位的根证书拆了,SSL 那张 32 小时,S/MIME 那张 29 小时,用的是他自己的 Ryzen 9 5950X。
上周五晚上,小玩具项目跑到一半断了。上下文满了,还是我手滑按了 esc,记不清。反正断的位置很尴尬——配置文件刚被它改了一半。 我重开一个会话,跟同桌说:接着刚才的改,把导出那块加完。 它接着了。顺畅,一路没报错。 今天下午我去读那段代码,才发现它接的是一个夹生的中间状态。

先说结论:这篇论文真正值钱的东西只有一句话——让 LLM 现场写交互状态机。标题里那俩大词,「个性化」和「集群」,都是凑出来的。 八个人署名。主分类 cs.RO,顺手挂了 cs.AI、cs.HC、cs.MA。 v1 挂上去到现在,没动过第二版。DOI 走 DataCite 发,注册状态写着待完成。
