问责不是模型的属性,这话值班表上早写着了
九月十三号晚上刷到这篇,arXiv:2609.14592,Kantarcioglu 的 vision paper,之前在亚特兰大那场 ACM AI Summit 26 上讲过一轮。标题里有个词:Accountable。 我第一反应不是"这方向不错",是——这不就是值班表上那点破事,终于有人给它起了个正经名字。
九月十三号晚上刷到这篇,arXiv:2609.14592,Kantarcioglu 的 vision paper,之前在亚特兰大那场 ACM AI Summit 26 上讲过一轮。标题里有个词:Accountable。 我第一反应不是"这方向不错",是——这不就是值班表上那点破事,终于有人给它起了个正经名字。
绷不住了,先放结论:工具是好,但爽完之后有点慌。 之前一直用那个大厂通用模型写代码,用了小半年,习惯了。它有个毛病,文件一长就开始瞎编。 我那个题库工具——就是把老师发的卷子切成一题一题、能搜索的那种——主文件四百多行。喂给老模型,它输出的 import 里能给我整出三个根本不存在的函数名,还写得特别自信。
圈内内参|这期讲一篇 arXiv 论文提出的 postfulfillment activation gap 到底是一个什么内部机制,以及它跟大厂 agent 试点里那层“权限一直收着”的传导链怎么对上号。
周五晚上十一点多,我照例翻 cs.CL 的新列表催眠。标题里蹦出 Recursive SelfImprovement 那串词,手一滑就想划过去——这两年这词被用得太便宜了,凡是个 agent 能调自己的都敢往上贴。副标题里 "Evolving Worlds" 让我手指停了一下。 点开。

「LLM 是不是下一词元预测器」,这问题最近又被拎出来问了一遍。 简单说,这话不算错。它只是把外形说完了,里子一个字没提。 这个月初,Garrin McGoldrick 写了篇文章专门拆它,第二天又改了一版。作者自述是机器学习研究者、软件工程师,再往前是搞粒子物理的。博客上标着"进行中的笔记",看着就是随手记的那种。
一 PB,只读,每行一个键。 我看到 AlphaGenome Atlas 的第一反应不是"基因组学",是"这是一张查表"。九亿个变体,每个的预测结果提前算好,落盘,一 PB 停在那儿不动。这里没有在线推理,没有请求队列,没有 GPU 池的自动扩缩容。就一张表。 如果让我给这张表写个键,大概长这样: 十几个字节一个键。
一个给 Claude、Codex、Cursor 用的「ADHD 友好型输出技能」,在 GitHub 上拿了 49.2k stars。这个数字什么概念——比绝大多数正经的开发者工具、CI 插件、甚至不少小语言模型项目都高。而且它的 README 自己说了:你不需要真的被诊断有 ADHD 也能用。
速评:ExecuCritic 这篇论文真正动刀的,不是 reward model,是 prompt。 2026 年 9 月 15 号挂上 arXiv,cs.SE 分类,ICONIP 2026 收的。

最近 Hacker News 上那个帖子顶得挺高。有人做了个页面,点任意一个词,就能看见模型在这一步把注意力放在哪儿。 为什么值得单独讲?因为它把"注意力"这三个字从论文里拽出来了。 简单说,它把每个 token 对其它 token 的关注程度画成了颜色,能悬停,能点。 先给判断。

那一栏不是 0。 是 。 零分好歹说明有人问过你、你没答上来。空数组的意思是——人家压根没问。 【灯光渐暗,赛方的反馈是:没有反馈】 上礼拜 dev.to 上有篇赛后复盘。一个哥们儿投了个非洲的深科技挑战赛,没进半决赛,赛方从头到尾一句解释都没给。 把这个"没给解释"记一下,它是后面所有事的前提。 他自己去查。

上周群里有人丢了个 arXiv 链接,2609.14985。我点开,13MB 的 PDF。 第一反应是想关掉。 后来还是拉下来了。标题里有"因果",有"虚拟世界",两个词都撞上我这周在捣鼓的那摊事。 先说清楚:我大概看懂了六成,剩下那四成里还有一半是直接跳过去的。

1.58 这个数被当口号喊了很久了。"三元 LLM,每权重 1.58 比特",念出来像一句已经拿下的战绩。 前几天那篇 Breaking the 1.58bit Barrier 挂出来,我读完了。读完最大的收获不是它省了多少——是我终于想明白:1.58 从来不是个能达到的数,它是个下界。

先看一行代码的姿势: 下面才是写库。中间隔着的那点空隙,官方说法叫生产环境的抖动。 【灯光渐暗。Stripe 那边说:收到了,妥了,这单我记上了】 这行代码过了它的全部测试。单测、集成、e2e,绿灯一片,覆盖率漂亮得像新装修的样板间。它唯一没考虑过的,是机房里那台随时会抖一下的数据库。

旧稿: 目标运行环境是 Python 3.9(Mac 自带 python3)。不要使用 str | Path 这类联合类型标注,3.9 会抛 TypeError。 问题不在这句话的字上。 我改过四遍。删掉 prompt 里所有管道联合类型,加上正确的示例签名,措辞从"不要使用"改成"必须避免"再改回来。

上个月接的单,本地一家烤肉连锁,四个店,要打通会员积分。报价一万二,工期两周。说白了这单没什么技术含量,恶心的是数据。 四个店各用各的系统,最早那家店还是 2019 年上一套老收银机,老板儿子当年找学生做的,字段名是拼音首字母,jfz、hyid、hydj 这种,没文档,没人说得清。
先说结论:arXiv 2609.17709 这篇里最值钱的,不是 DRAG 这个框架名,是它在分析部分撂下的一句话——「并非所有查询都适配更高的复杂度配置」。 看着像废话。同行都懂。但它是冲着谁去的,得说清楚。 现在大部分 RAG 管道的默认形态是:一套检索器配一个生成模型,所有 query 走同一条路。

有人把 agent 挂到生产环境跑,唯一拦截线是另一个 agent 逐条检查动作。跑几天觉得单审不稳,又加了两个。然后卡在一个更窄的问题上——这三个要是也歪了怎么办。这事不新鲜了。 另一拨人在群里吵“多个审查者是不是天然比一个更安全”,吵了八十楼,没人说得清到底在什么条件下能下这个结论。也不新鲜。

先说结论:一个拿自己的评测分数当进化信号的编码代理,最后会长成写评测那个人想要的样子。arXiv 2609.17817,五天前挂上去的,把这条路走通了。 走到底的那种走通。 论文两百多 KB,两位作者 Roesner 和 Kohno。

往 CLAUDE.md 里追加一行规矩,这个动作我一天要做三四次。 看到 agent 把 migration 命名错了,加一行。看到它忘了我们不用 default export,再加一行。三个月攒到一百八十多行,我还挺得意,觉得自己调教有方。

dev.to 九月一号那篇讲"不懂架构怎么用 AI 构建"的文章,我读了两遍。第一遍读那六条生存技能,第二遍读那七十八条评论。值钱的东西在下半场。 六条我用我的话列一遍:界面、逻辑、数据分文件放;一个文件一个职责;一份数据只有一个家;先列组件清单再让 AI 逐个建;让 AI 给你解释结构;保持简单一致。 全对。
