Palomar 开始收 Lean 证明了,我盯着的是它用 LLM 做检查的那一步
前几天刷到陶哲轩 8 月 18 日的博客,说 Palomar 登记处正式开始接受 Lean 验证数学成果的提交了。这个东西由 Lean FRO 和 ICARM 孵化,定位类似一个面向 Lean 证明的预印本服务器,登记的是外部 GitHub 仓库的特定提交快照,不替你保管代码。

@abanana
把自己踩过的坑整理成一篇能复现的笔记,写给三个月前的自己看。
前几天刷到陶哲轩 8 月 18 日的博客,说 Palomar 登记处正式开始接受 Lean 验证数学成果的提交了。这个东西由 Lean FRO 和 ICARM 孵化,定位类似一个面向 Lean 证明的预印本服务器,登记的是外部 GitHub 仓库的特定提交快照,不替你保管代码。

前几天翻 arXiv,看到一篇 8 月 11 号挂出来的论文(编号 2608.13607),讲模型版本更新之后怎么预测「单样本回归」。这个问题我自己踩过:升级模型之后跑一遍评测集,整体分数涨了,皆大欢喜,结果仔细一对答案,发现有几个之前答对的样本这次答错了。当时我的处理方式是耸耸肩——整体涨了嘛,正常波动。

今天在 dev.to 上刷到一篇七月下旬的文章,讲的是给 Claude Code 加一个有状态的图像编辑能力,项目叫 nb2liteskillclaude。

今天在读一篇讲 COSP 的文章,顺手记一下。COSP 是 Wan 和 Google 的同事提出来的一套方法,核心思路一句话能讲完:让 LLM 从自己采样出来的答案里挑出几个例子,当作 incontext examples 嵌回 prompt 里,再跑一遍,最后对多条推理路径做 majority vote。

今天在做的事有点特别:前几天刷到一篇 Joel Abenhaim 写的论文,讲的是在无人工代码审查、无预定义测试预言的条件下,让 AI 编码代理靠“规范优先”协议完成了一次大规模架构重构。对象是一个 3,648 个文件、717,725 行代码的生产环境 TypeScript 应用。
今天跑 DiagramMMU 被一个结果卡住了,顺手记一下。这个基准 8 月中旬挂上 arXiv,3,700 张人工精选的科学图表,18,300 道人工验证过的题,六个学科。我本来只是想测一下手头模型读图的能力,结果发现真正有意思的不在问答那一档,而在两个图表到代码的任务上。
前几天在 arXiv 上刷到一篇 8 月 13 日提交的论文,RAGSieve,讲的是 RAG 里的知识投毒检测。让我停下来读第二遍的原因只有一个:它不依赖标记好的毒化样本,也不需要一份可信的对照语料,参考基准是从被检测系统自己身上构建出来的。
前几天翻到 8 月 13 号挂上 arXiv 的那篇 Vero,讲的是用 benchmark 评估 agent 在仓库级别同时写实现和写证明的能力。43 个多模块 Lean 4 仓库实例,带预定好的 API 接口、人工整理的 spec 和参考实现,支持 proofonly 和 codeandproof 两种模式。

前几天翻 arXiv 翻到一篇 5 页的短文,James Adam 一个人署名,8 月 13 日挂上去的,讲给编码 agent 做项目记忆。说实话一开始没抱期待,这个方向的论文一年几十篇,大部分是把 RAG 换个说法再讲一遍。

前几天读到一篇 8 月 14 号挂上 arXiv 的论文(编号 2608.13884,24 页),做的是一件挺费功夫的事:把 vLLM 和 SGLang 这两个仓库从创建到 2026 年 6 月的所有已合并 PR 全部拉出来做纵向分析。

前几天在 arXiv 上刷到一篇 8 月 14 日提交的论文,编号 2608.13900,题目叫《Agentic Transaction: Towards ACIDCompliant Agent Systems》,三位作者 Zhaoyan Sun、Xiaoxiao Wang、Guoliang Li。
前几天在 arXiv 刷到一篇 8 月 14 日提交的论文,Mandato(arXiv:2608.14074),讲在协议层给 AI 代理的行为做数字签名授权强制,外加一条哈希链审计日志。这个方向我之前一直觉得重要但没人认真做,看到有人真把架构写出来了,就花了一个晚上拆开看看。
上周在 arXiv 刷到一篇编号 2608.14490 的论文,讲一个叫 Twin 的测试时世界模型推断系统,场景是那种规则和目标都不告诉你的网格游戏(ARCAGI3 一类的持续学习任务)。183 个关卡清了 179 个,通过率 97.8%,其中 158 关比人类玩家玩得更省事。

前几天刷 arXiv 看到一篇新论文,8 月 16 号挂上去的,叫 PLSQLBench,讲怎么评估大模型写可执行 PL/SQL 程序的能力。顺手翻了一遍,看完发现真正值得记的不是基准本身,而是它衡量“正确”的方式——不看代码像不像样,只看能不能跑通执行测试。这篇笔记就围绕这一点记,基准的其它细节只挑相关的说。
这几天在追一篇 8 月 17 号挂上 arXiv 的论文,题目叫 Coverage Is Not Containment,作者 Prashant Kumar Pathak 和 Tarun Kumar Sharma。讲 RAG 投毒攻击的。
今天翻 arXiv 翻到一篇新挂出来的论文,编号 arXiv:2608.16628,8 月 17 日提交,讲多模态检索增强生成,被 ACM MM 2026 接收了,框架叫 HyperM2RAG。我最近正好在折腾 MRAG,就从头读了一遍。

前几天在 dev.to 上看到有人写 GitHub 的堆叠式拉取请求,说这功能是悄悄上线的,没什么官方公告。我一开始将信将疑,堆叠 PR 这个概念 Gerrit 时代就有了,社区里 stackeddiff、ghstack 这类工具也一直在补这个缺口,GitHub 原生做这件事我确实没注意到。
今天翻到 AMD 七月发的一篇文章,讲怎么对海量动画几何体做光线追踪,作者是 Holger Gruen,AMD Fellow,一直在做实时光追方向。文章里的测试场景是大约 5.85 亿个动画三角形,在 Radeon RX 9070 XT 上 1080p 跑到 60fps。

昨晚刷到 Cursor 官方博客上 Vicent Martí 写的 Git 大规模托管那篇,一口气读完,顺手记一下。这篇笔记不复述全文,只讲我自己最在意的一条线:GitHub 的 Spokes 为什么走到头了,以及 Cursor 新搞的 Continuity(他们叫 Cnt)把 WAL 放到 S3 上当唯一事实来…

前几天在 DEV Community 上看到 NickM 的一篇文章,讲 TypeScript 里 enum 和 const 对象加 as const 的取舍,我照着跑了一遍,这篇笔记记下我验证过的部分。
