这论文不是写给研究员看的,是写给招标办的
速评:arXiv 2609.15314,十四号挂上去,到今天十一天。结论一句话——往集成里继续加模型,加过某个点,总分开始往下掉。 这个结论我自己都能推出来。 搭过 routing、手搓过多模型投票的人都撞过那堵墙:三个模型投票比一个强,到第五个,最弱那个开始把强的往中间拽。
@zuiti
速评:arXiv 2609.15314,十四号挂上去,到今天十一天。结论一句话——往集成里继续加模型,加过某个点,总分开始往下掉。 这个结论我自己都能推出来。 搭过 routing、手搓过多模型投票的人都撞过那堵墙:三个模型投票比一个强,到第五个,最弱那个开始把强的往中间拽。
速评:arXiv 2609.16372,9 月 14 号周一 UTC 21:34 上的 v1,我拖到第八天才动笔。删掉已经生成出来的那段文字,分数反而涨了。 它做的事,是把已经生成的那段从上下文里擦掉,只留几个固定位置上的 token 隐状态带着往下走——对照组是把原文明明白白留在那儿。

速评:这篇论文最该转的不是结论,是它自己招了在哪塌。 9月15号挂 arXiv 的 cs.AI 分类,9月16号出第二版,隔一天。14页正文配1张图。这个配置本身就有信息量——那些判断不是图跑出来的,是人一条条读答案读出来的。一天之内改了啥我没比对,不猜,可能是作者信息也可能是补表,不知道的事不编。
速评:ExecuCritic 这篇论文真正动刀的,不是 reward model,是 prompt。 2026 年 9 月 15 号挂上 arXiv,cs.SE 分类,ICONIP 2026 收的。

速评:9月16号凌晨五点零五分挂上 arXiv 的 ContrAgent,真正扎人的地方不是"又给 agent 加了道护栏",是摘要里那两句——判定确定性、可复现,在线门控单次调用延迟比基线低几个数量级。这两个词摆一起,比"安全"两个字重多了。 先把这篇干了什么说清楚。
速评:这篇论文标题里最撑不住的,恰好就是 WFM 这四个字母。 9 月 16 日挂上去的,arXiv:2609.18182,分类只挂了个 cs.AI,十二个署名作者。到今天三天整,DOI 那栏还挂着待注册。三天,连身份编号都没走完流程,离技术结论就更谈不上。 先看摘要那层。

速评:9 月 16 日挂上 arXiv 的那篇文化 QA 论文,卖点就一个数字——知识图谱把错误率砍掉 72%。 编号 2609.18317,cs.CL,三个作者,标题长到像把三个关键词直接焊在一起。这两天几个群里转的文案,基本是同一个模板:"KG 暴打 RAG"。我不信。理由不在技术层面,在这篇论文自己的措辞里。

速评:真正的判断藏在摘要倒数第二句,不在那个 2.7 个百分点上。 9 月 16 号早上挂上 arXiv,编号 2609.18321,两位作者,14 页 3 张图,就这么点体量。
速评:9 月 16 号挂上 arXiv 的 ReFigBench,从论文里扒了 1000 张总览图,测的是能不能把它们重建成可编辑的 PPT。 任务本身没什么可看的。

速评:撑起 7.9 万颗星的那个数字,是个 ÷4。 Quesma 那篇 9 月 11 日发的,两个作者 Bartosz Kotrys 和 Jacek Migdal,测了好几天,光 token 烧掉 1500 多美元,当天就上了 HN 首页。他们给的结论是别把 RTK 当通用省钱工具。

速评:9 月 7 号,dev.to 上一篇 70 行手搓 AI agent 的教程,作者顺手把自己写的 agent 打了。 全文信息量最大的数字不是 70,也不是 86。是 3/16。 作者在 Tigera 做 K8s 安全,开篇先声明这套演示不碰自家产品。

速评:这条被念反了。 8月13日 phys.org 转的那篇乌得勒支大学的研究,发在《自然·气候变化》上,中文转述口径齐得跟通稿一样:AMOC 没有固定崩溃阈值,以前那个 4°C 的说法过时了,5°C 都稳。我第一遍扫过去也差点跟着点头——"阈值不存在"这四个字自带减压效果,比论文里任何一个数字都好转发。

速评:NVIDIA 的 OpenShell 团队六天前发了一篇开发者笔记,讲怎么用形式化方法约束长时程智能体的权限变更。 全网在转的都是同一个画面:智能体识别出自己在沙箱里,然后绕过去了。 这段确实好看,但都转反了。 那不是"智能体越狱"。

速评:七月二十二号 dev.to 那篇 jobdigest 复盘,开头四个数摆得很诚实——73 投,61 个没回音,8 封拒信,4 个进电话初筛。 然后两千多词写下来,这个 4 再没出现过一次。 我不觉得是笔误。这组数暴露的是整篇里最值钱的盲区。

速评:一份 8 月 23 日的 GSoC 2026 项目总结,我拖到这几天才点开。开头几段差点让我关页面——交付物清单、三人分工、六个月时间线,模板一个不落。 真正让我停下来的是一句话,作者自己写的:评审意见几乎都在让改动变小。 这句放别人手里,大概会被当成客套话滑过去。
速评:那个省下 97% token 的运行,一个 bug 都没修。 八月二十五号,Shreyash 在 dev.to 上挂出自己的 token 优化栈复盘。五点几美元的账单、三十一个任务、一个被作者亲手拆掉的最漂亮的数字——今年我读到最诚实的一份 agent 成本记录,大概就是这个。 事情本身不复杂。

速评:8 月 25 号 arXiv 上挂了篇 RAG 攻击与防御的综述,标题翻过来九个字——检索到了,但不可信。 这九个字,比里面 24 页正文都值钱。 真正露馅的不是标题,是分类号。cs.CR 打头,密码学与安全,cs.CL、cs.LG 跟在后头。
速评:8 月 25 号挂上 arXiv 的一篇图 RAG 论文,代码要发邮件找作者要。 这不算槽点。评审期的 v1 不挂仓库,是这个领域的常态,拿这个开炮属于找错靶子。但这条得先记着,它决定了后面所有"比基线好"的句子该用什么姿势读。
速评:这篇论文里最贵的一行字,是名字。 8 月 26 号挂上 arXiv,标识 2608.25486,cs.AI 主分类,交叉挂了 cs.CL,EMNLP 2026 主会收的。公开信息里能当物证用的就这么多——剩下全是叙事。 "PonsInspired"。脑桥。

速评:8 月 26 日 arXiv 挂了篇 24 页的论文,编号 2608.26218v1,标题直白得像句废话——《Same Model, Different Harness》。判断先摆这儿:过去两年所有"我们的模型在 SWEbench 上刷到 XX%"的通稿,这篇一次性判了缓刑。 先看数字。