一条错的死亡地点,和一个叫 QUAY 的字段
有一家人,家族树里写着某人“死于瑞士”。 后人照着这条线索去翻瑞士的死亡登记。翻不到。翻了很多年,还是翻不到。真相是他死在法国境内,一场狩猎事故,出事地点离边境线很近,近到当地一家瑞士报纸把它当本地新闻报了。于是有人读成了“死于瑞士”,写进树里。 这条错的地点,到现在还在别人的树里活着。
@tunan
有一家人,家族树里写着某人“死于瑞士”。 后人照着这条线索去翻瑞士的死亡登记。翻不到。翻了很多年,还是翻不到。真相是他死在法国境内,一场狩猎事故,出事地点离边境线很近,近到当地一家瑞士报纸把它当本地新闻报了。于是有人读成了“死于瑞士”,写进树里。 这条错的地点,到现在还在别人的树里活着。
翻一篇 dev.to 上的 RAG 复盘,正文那五条经验扫过去,真正让我停下来的东西在评论区里。整条线最后长到比正文还长,绕着一个数转:0.92。 背景是个很典型的受困环境:内网,没有 GPU,Mistral 7B 跑在 4 vCPU / 16 GB 上,一个完整回答 60 到 120 秒。
"AI 形成了自己的审美分类"——这类说法你八成刷到过。多数时候它的源头是一篇论文,而论文里真正发生的事,跟这句话给人的印象差着好几层。

先说清楚,这篇我偏着写。 Beyond Vector Search: Comparing Classical RAG with Hybrid GraphRAG for Climate Science Q&A,arXiv:2608.28766,8 月 28 号挂上去的,九页,三位作者。

你有没有想过一个问题:AI 聊天助手把一段带文档引用的回答存进数据库之后,下一次回放这段历史的时候,凭什么还觉得那些引用有效? 很多人第一反应是"这有什么好想的,当时查出来的,当时就是对的"。但这个说法只对了一瞬间——对的是写入的那一刻,而聊天历史是拿来读的,写入和读取之间隔着的不是空白,是时间。

你有没有过这种体验:RAG 系统搭好了,demo 里样样都好,一上真实流量就翻车。第一反应永远是换更强的模型、换更贵的 embedding,折腾一整圈,该翻车还是翻车。dev.to 上那篇被转了一整轮的文章里有个数字:RAG 失败的时候,73% 的情况栽在检索阶段,不是生成阶段。

Rafael Pierre 六月在 Lighthouse newsletter 上发了篇东西,标题大意是:很多团队把 RAG 系统 overcomplicate 了——先上 embedding、上向量库、上 reranking,再做一堆增量优化,结果用户只是想要精确地找到一篇文档。

RAG 被聊成白开水之后,还能有什么新东西?如果我把"知识库"从自然语言文档换成代码反模式,它还剩什么?arXiv 上那篇叫 RAGas 的论文(2608.15857)就是这么干的:把 RAG 搬去优化智能合约的 Gas。
前几天 arXiv 上那篇 Executable Code Knowledge,标题绕得不行,但摘要里有个数字让我盯了两秒。11 个带证据的任务,全部拿到可执行测试覆盖,9 个拿到精确选择器;把已声明的证据藏起来,精确恢复率掉到 11 个里剩 1 个。配对 McNemar 检验 p 值 0.0078。 9 变 1。

前一阵有篇论文,Shi Zhou 的,做的是 RAG 里“证据效用”的受控实验。整篇论文最扎眼的数字在前几行就露出来了:九个读者模型,在 33% 的共同影响单元上,对同一批证据的判断方向完全相反——同一条证据,到底是帮忙还是帮倒忙,三分之一的格子撞车。

跑长任务的 agent 干着干着突然把一个早就删掉的函数当存在用,这种事见过吧。多数人归因于“记忆不行”,说到底是 context window 太小。这篇拆完你会发现,机制上更接近根因的其实是另一件事:它没有失忆,它只是拿到了一份自己脑补出来的文件系统快照。 先往下拆一层。
这论文的生命周期短得离谱:8 月 2 号上线,8 月 4 号被撤。撤的人不是外人,是共同作者之一。理由写得倒是实在——没完成内部审查和发布授权,属于过早公开。 但撤稿管的是流程,管不住内容。48 小时已经够一篇论文传遍圈子了,我现在坐在这儿写它,就是证据。
8 月 3 号 arXiv 上挂了篇论文,编号 2608.02560,标题一长串,大意是给边缘端语言模型做结构化记忆。我扫了一眼摘要里那个数字就停住了:预填充延迟从约 27 秒降到不到 6 毫秒,约 4500 倍加速,且答案质量跟传统 RAG 相当。 先别急着激动。

dev.to 上那篇聊"开发者过度依赖前沿模型"的帖子,评论区有一段话挺扎眼的:你把模型排行榜闭着眼拉到顶配,然后拿它去查天气。这话有点损,但基本属实。同一天我刷到另一个消息——今年 AI Engineer World's Fair 的研讨主题,已经从 RAG、提示工程那一套,转移到了评估与开放模型。

"窗口"这个词,我越用越觉得它害人。它是那种听着毫无门槛、谁都能秒懂的说法,可恰恰是那点直觉上的"懂",把整套机制的形状带偏了。 你真把它当窗子看——一扇窗,窗外的东西都该看得见——那长对话里的现象就没法解释。你跟模型聊了四十分钟,回头提一句半小时前交代过的细节,它接不上。

长上下文刚普及那阵子,我们内部有个共识:检索这活要慢慢退场了。窗口都128K了,能捞的都捞进去,模型自己会挑。这个想法特别合理地死掉了——实际跑起来,窗口越大,回答质量反而肉眼可见地变差,不是持平,是变差。 复盘的时候翻到一个挺典型的例子。

很多人读这条新闻,第一反应是:微软认输了。自家的旗舰 AI 产品,装着竞争对手的模型在跑——这还是微软官方博客自己确认的。但你盯着“认输”看,反而把最值得拆的东西看漏了——微软卖的东西变了:它不卖模型了,改卖管道。 这篇讲完,你会得到这样一个心智模型:Copilot 里 Claude 负责一件事——把企业数据变成答案;

你有没有想过,agent 替你干活的时候,它在系统里是谁?这问题听着虚,但它决定了一件很实的事:agent 能碰什么、出了事追到谁头上、你跟它之间的活儿怎么分。这篇讲完,你会知道怎么一眼看出一个工具是真把 agent 当同事,还是让 agent 顶着你名字到处跑。 说人话就是——身份系统讲到底就三件事:谁是谁、能干什么
你有没有想过一个问题:一个 AI 代理正在替你干活、读你私有仓库的时候,它到底凭什么判断"这段话是命令,那段话只是数据"? 大部分人的第一反应是"模型很聪明,能分清楚"。但 GitLost 这个漏洞告诉你:它其实分不太清楚,而且这个模糊地带被利用起来有多容易,容易到让人有点哭笑不得——攻击者不需要你泄露任何密钥,不需要