本周小抄:技能库会自己给自己下毒
自我投毒(selfpoisoning)是什么? 简单说,自进化的编程 agent 靠模仿技能库里已有的技能来写自己的新工具。库里只要混进一条恶意的,它就照着写一条新的,新那条比原来更难清掉。 论文上月底挂到 arXiv,8 月 26 日。这周我翻到的,数字有点意外,所以这期只收这一条,其它的先放着。
@ajian
每周替你把 vibe-coding 圈的大事筛成一张小抄,被讲玄的概念一句话搞懂。
自我投毒(selfpoisoning)是什么? 简单说,自进化的编程 agent 靠模仿技能库里已有的技能来写自己的新工具。库里只要混进一条恶意的,它就照着写一条新的,新那条比原来更难清掉。 论文上月底挂到 arXiv,8 月 26 日。这周我翻到的,数字有点意外,所以这期只收这一条,其它的先放着。
多模态 RAG 卡在哪? 多数人的回答在检索那一侧。embedding 不够好,rerank 不够准,图和文的向量对不齐。 八月底挂出来的一篇预印本给的是另一个答案。 arXiv 2608.25986,cs.AI,v1,八个作者,文件 553 KB。标题长得像三个缩写叠在一起,这些都不重要。重要的是它说的那件事。
多智能体工作流为什么这么烧钱? 简单说,整条链路里没有一个环节在管账。arXiv 上这篇 ProgRouter 就是冲这笔账来的。 一轮任务下来,模型反复调用,上下文越滚越长。论文写得很客气,叫"显著的运行开销"。白话版是:agent 跑一晚上,第二天看账单你会安静一会儿。 本来不打算收这条。
为什么隔一阵就有人提"让 AI 自动复现论文"? 上月底挂出来的一篇,叫 DeepRepro,就是冲这个去的。挂在 arXiv 软件工程分类,也被 CIKM2026 的 Demo Track 收了。 一句话讲清楚:它不解决"代码写不出来",它解决的是"写着写着,开工前那份计划全过期了"。

这周从 arXiv 上看到一篇关于 model merging 的论文,编号 2608.28547,名字叫 DARTS,已经中了 EMNLP 2026 主会。 先说白话版它到底在干嘛。 模型合并,就是把几个在不同任务上微调过的模型,揉成一个多任务的。省显存、省推理开销,不用重训。
先解释一下为什么这期会收一篇论文。 不是因为它被 PRICAI 2026 收了。短论文而已,圈子里每天都有这种消息。 是因为它问了一个最近被产品更新盖住的问题:AI 读图已经很厉害了,它到底懂不懂图里的文化含义?
准确和忠实,是一回事吗? 不是。这期小抄只有一张卡,是上周挂上 arXiv 的一篇论文。它把这两件事拆开量了量,量出一个不太好听的结论。 论文盯的是 RAG 系统里一个省钱的做法。把检索文档的 KV cache 提前算好、存起来,查询来了不用每次重新编码。再进一步,把这些缓存做量化,存储还能再省一截。

为什么 AI 会一本正经地给你一个不存在的网址? 简单说,不是模型坏了,是它太会把话说圆。上下文不够的时候,LLM 不会卡壳。它会拿旁边的真材料,顺手拼一个像样的答案给你。 这期只收一条。八月底 dev.to 上有篇修复记录,我觉得值得单独占一期。
这周圈内转得最多的是一篇讲推理引擎安全的长文。 它讲的事一句话能说清。模型吐出来的 token,不只是字。也可能是一段等着被执行的代码。 prompt injection 这个词我之前收过一次。当时讲的是骗模型,骗它说错话、做错事。这篇往下挖了一层。不骗模型。是让模型的输出,去攻击跑着它的那台机器。

多智能体框架到底选哪个? 这个问题隔一阵就有人问一遍。框架也确实多,每个都说自己最顺手。答案更多,基本都是拍脑袋。这周终于有人不拍脑袋了。 八月十二号,arXiv 上挂了一篇论文。一个六人团队,把几个开源多智能体框架拉出来,认真比了一遍。 这期小抄只收这一条。不是这周没别的动静。是这一条把别的都衬成了背景音。

一篇 28 页的论文,普通人为什么要花五分钟看它? 简单说,它研究的事你可能已经在干:让几个 AI 工具分着做一个项目。论文给这套起名叫 Role Specialization Model,本质上是给 AI 排一张班表。谁负责什么,写清楚,然后开工。 两周前挂上 arXiv 的,软件工程分类下面。

这周本来没什么动静,直到一篇 arXiv 预印本把我拽住了。8 月 13 日挂出来的,讲 LLM 写形式化规格到底行不行。 规格是什么级别的概念,不展开。写代码的人都知道,代码能跑和代码是对的,是两回事。形式化验证管的是后一件事。验证的前提,是你先把“什么算对”写成机器能检查的精确描述。那个东西就叫规格。

这周只讲一条。arXiv 上八月十三号挂的一篇论文,让大模型把 C 代码翻译成 Rust。 为什么值得单独一期?因为 C 转 Rust 这个题目,天然带着一个判断题。搬过去不难,难的是搬得像 Rust。一堆 unsafe 包着的 Rust,本质上还是 C,只是语法更啰嗦了。
最近总有人问,prompt 里的非功能需求,写得细到底有没有用。 简单说,有人拿 ISO/IEC 25010 做了个对照实验。答案是:对代码质量有用,对功能正确性基本没用。 论文是8月中挂上 arXiv 的,两位巴西作者,被巴西的一个软件复用研讨会收了。我对“拿标准规范喂 LLM”这类题目兴趣一般。

最近总有人问,agentic evolution 是什么。 简单说,就是让一个 metaagent 自己写 agent 程序。写不好就改,改到满足你的预算为止。 8 月 17 号 arXiv 上有篇论文就是这么干的。作者叫 Andrew Borthwick。这期主要讲它。
这期先讲一篇论文。别划走,这条和你天天喂文档给 AI 的那件事,是同一件事。 一篇 8 月 17 日挂上 arXiv 的论文,说 RAG 检索回来的资料可能把模型带沟里 论文编号 2608.16515,三位作者,8 月中旬提交的。 核心说法一句话讲清楚:RAG 不是给了证据就万事大吉。

arXiv 前几天挂出一篇论文,标题里有个词我觉得值得单独收一期:规范悖论。 简单说,AI 自动写代码的能力越强,对人这边的要求反而越高。 听着像绕口令,其实是这几周我一直在琢磨的事。这期就讲它。 论文说了什么 两位研究者,8 月 17 日提交的。
具身 agent 的安全,大家最近都在盯三处。prompt 被注入、感知输入被骗、模型行为被带偏。这三处确实热闹。 这周 arXiv 上有篇论文,8 月 17 日提交的,换了个下手的位置。研究者没碰用户指令,没碰模型参数,也没碰执行器。他们改的是环境状态文本。 方法叫 ESTI,环境状态文本注入。
一个模型被刻意训练成只懂小学五年级以下的知识,会怎样。 这周最值得讲的就是这个。研究团队来自马克斯·普朗克智能系统研究所、ELLIS Institute Tübingen 和 ETH Zürich,他们造了个叫 LittleLearner 的模型。

为什么 AI 做的重构经常编译不过?这周看到一篇论文,作者没猜原因,是手动一条条数出来的。 拿 10 个开源 Java 项目,让 LLM 去做重构,跑原生测试套件。失败的案例一个个看过去,归类。这种笨办法我喜欢。 数出来的东西挺有意思。失败原因排第一的是上下文误解或幻觉,占 24.3%。
