本周小抄:两个来源吵起来的时候,信哪一个
AI 查了资料再回答,就一定更准吗。 不一定。 九月十四号 arXiv 上挂了一篇医学方向的论文,arXiv:2609.16301,三十一页。它处理的就是大家都跳过去的那一环:检索回来的证据互相打架的时候,信哪一个。 简单说,这篇讲的是裁决,不是检索。 这期本来想多收几条。

@ajian
每周替你把 vibe-coding 圈的大事筛成一张小抄,被讲玄的概念一句话搞懂。
AI 查了资料再回答,就一定更准吗。 不一定。 九月十四号 arXiv 上挂了一篇医学方向的论文,arXiv:2609.16301,三十一页。它处理的就是大家都跳过去的那一环:检索回来的证据互相打架的时候,信哪一个。 简单说,这篇讲的是裁决,不是检索。 这期本来想多收几条。

编码 agent 一进大仓库就犯迷糊,问题出在哪。 简单说,不是模型不够聪明,是它一次能看见的东西不配套。这周收的 RepoAtlas,就是冲这个来的。 9 月 15 日挂上 arXiv,v1,编号 2609.16936,归在软件工程下,也标了人工智能方向。八个人,第一作者 Yunxiang Zhang。
便宜模型能不能替你把一份需求文档翻成能跑的代码? 上周 arXiv 挂了篇论文,测的就是这件事。编号 2609.18052,9 月 16 号提交,两位作者,Adikari 和 Herath。7 页,7 张图。 结论不好看。 实验是这么做的。
TradingAgents 是什么? 简单说,它是一个用一群 LLM 智能体模拟交易公司分工的开源框架。 这期本来想跳过它。一个"让 AI 替你炒股"的仓库,看着就像那类靠 demo 攒星的东西。翻完它今年二月到九月的版本日志,我改主意了。 它长什么样 分析师分四个方向:基本面、情绪、新闻、技术。

最近老看到一句话:FDroid 上 64.7% 的应用是 AI 写的。 简单说,数字不假。它的含义和大多数人以为的不一样。 来源是一周前一篇个人调查。作者是 FOSS 应用的维护者,业余做,还是个学生。样本是 9 月 12 日推送的一批更新,102 个应用。

「LLM 是不是下一词元预测器」,这问题最近又被拎出来问了一遍。 简单说,这话不算错。它只是把外形说完了,里子一个字没提。 这个月初,Garrin McGoldrick 写了篇文章专门拆它,第二天又改了一版。作者自述是机器学习研究者、软件工程师,再往前是搞粒子物理的。博客上标着"进行中的笔记",看着就是随手记的那种。
最近 Hacker News 上那个帖子顶得挺高。有人做了个页面,点任意一个词,就能看见模型在这一步把注意力放在哪儿。 为什么值得单独讲?因为它把"注意力"这三个字从论文里拽出来了。 简单说,它把每个 token 对其它 token 的关注程度画成了颜色,能悬停,能点。 先给判断。

"构建速度超过理解速度"是什么意思? 简单说,就是你做出了一个能跑的东西,但你没跟上它的原理。 这周拎出来讲,是因为 Mark Seemann 三天前在 blog.ploeh.dk 发了一篇公开信,回一位读者的提问。这是我近段时间看到最实在的一篇,讲 LLM 和学编程的关系。 先把那位读者交代清楚。

为什么有人发帖越来越勤、写得越来越顺,读的人反而越来越少。 简单说,不是内容变差了。是读者认不出那是你写的。 这句听着像在挑文风。不是。文风是审美,认不认得出人是可信度。审美你可以不在乎,可信度你没法不在乎。 这条我本来没打算收。它讲的是 LinkedIn,跟我平时收的不完全是一类。但它问的那个问题,我每周都要碰一次。
agent 答错的时候,第一反应总是模型不行。 这周收的几条材料给的是另一个答案:它该知道的东西散在别处,模型压根不知道那些东西存在。 散在哪?文档里、工具返回里、聊天记录里、issue 评论里、AGENTS.md 里、本地文件里、几个 API 的响应里。都在,就是不在它眼前。 dev.to 八月下旬那篇拆得最清楚。

先问一句。两个 agent 凑在一起干一件活,来回聊了十分钟。这笔账谁付。 简单说,付钱的是用它们的人。每一轮对话都按 token 计费。机器和机器说得越多,账单越厚。 这笔账你不在场也要付。你只是把活交出去,没看见它们在背后聊了什么。 token 这个词我前面提过几次,这次它的角色不太一样。
有人问,vibe coding 这个说法还能叫几年。 简单说,它大概会像"网上相亲"一样,自己消失掉。 三个月前,Joe Marshall 写了篇东西,标题是《Vibe Coding is the new Internet Dating?》,发在他自己的站点上。

最近总有人转一个站,Transitions.dev。 简单说,就是个 UI 过渡效果的收藏站。做它的人叫 Jakub Antalik。 这种站以前也有,不新鲜。让我收它的,是它自己标出来的定位:给 AI agent 用的 UI 过渡。 这句话值得多想一秒。以前动效谁做?设计师,或者前端手写。
Hetzner 开始做 LLM 推理了。这事对普通人有影响吗。 简单说,它开了一个免费的、OpenAI 兼容的推理端点。只有一个模型,没计费,没 SLA,随时可能关。 这一周能一句话讲清"对普通人意味着什么"的,我只挑出这一条。不是别的动静不大,是别的我都讲不出一句让人记住的白话。

为什么一篇讲专利检索的论文,值得放进本期小抄。 因为它把 RAG 里一直由人来干的那一步,交给了模型自己。 这篇 8 月 11 日挂上 arXiv,编号 2608.11030,主分类 cs.IR,交叉列了 cs.CL。九个作者,第一作者 Jian Zhang。同时也被 IEEE CSCWD 2026 接收了。

最近到处都在转那个 LLM 水印测试。 简单说,就是给你三道文本,其中只有一道带了水印,让你猜是哪一道。十道题,全做完才能看答案。 结论先摆:绝大多数人猜不出来。评论区报分什么数都有,3/10、0/10、4/10、1/10、2/10,也有 7/10 和 8/10。有人算过,每题三选一,3/10 跟闭眼蒙没差别。

上个月 arXiv 上有篇论文,副标题里有个词挺扎眼,软件的去民主化。 它说的是:AI 让更多人能把代码写出来,但能让这些代码真正立得住的人,没变多,反而更集中了。 这跟我们平时听到的那套话,正好反着。 论文反驳的是那种预测,生成式 AI 很快会写完所有代码,编程这件事要结束了。作者没接这个。

最近有人问我,RAG 系统只要答对率上去了,是不是就算调好了。 不是。 8 月 25 号,arXiv 上挂了一篇预印本,编号 2608.24753,主分类 cs.CL,标题叫 The RAT,做的是一套 RAG 评估的贝叶斯框架。

前几期塞得满,这周只收一条。 不是没动静。是动静都太吵,挑不出一句能对普通人讲清楚的白话。吵的那些下周再说。 留下来的这条,8 月 25 号挂在 arXiv 上,cs.CL,交叉到 cs.IR,作者两个人。标题里有个 Less can be More。这种标题一般两种下场,要么标题党,要么真把常识说反了。 这条是后者。
最近又有人问,RAG 到底解决了什么。 简单说,它让模型先查资料再开口,不是全靠脑子里记着的那点东西。 问题是,查到的资料本身可以是错的。 八月底有篇论文就是冲着这件事来的。ReliableRAG,arXiv 编号 2608.25487,主分类 cs.CL,九个作者,第一作者 Jinpu Jiang。
