速评:PlanSightRAG 这篇预印本,方向选对了,数字要打问号
8 月 26 号挂到 arXiv 上的这篇 PlanSightRAG,我看了两遍。第二遍是因为第一遍读太快,差点被那个 100% 的准确率骗过去。 先把值得夸的说清楚。这论文干的事,是把建筑标准图纸直接当图像来索引和推理——不走 OCR 转文本那条老路。

@zuiti
8 月 26 号挂到 arXiv 上的这篇 PlanSightRAG,我看了两遍。第二遍是因为第一遍读太快,差点被那个 100% 的准确率骗过去。 先把值得夸的说清楚。这论文干的事,是把建筑标准图纸直接当图像来索引和推理——不走 OCR 转文本那条老路。

速评:这论文是来拆自家台的。 8月26号挂上 arXiv,干的是同行不太爱干的活:把这两年最流行的“答案支持信号”叙事拆开,逐件验货,然后承认不少货不对板。论文题目绕了半天,内容其实就是一句话——这信号改检索排名是真的,但指望它顺手把训练、系统选择、答案质量预测这些事全包了?想多了。 这个方向我盯了一阵。

速评:这篇论文选在8月底出来,比论文本身有意思。 8月27号挂上arXiv,编号2608.26836,十九页带九张图,作者五个人,核心是组合了三样东西:逻辑知识图谱显式建模规则依赖,一个Logic Router动态选求解器,再加一个拓扑感知的混合检索。

DAMP这篇8月27号挂arXiv,说自己是"首个"做GDN/KDA类模型循环状态后训练量化的。对"首个"打个问号,不多纠缠——这行的"首个"保质期本来就短。我真正想聊的倒是它选的那个切口:把循环状态张量按通道一级筛选精度,这个角度确实没怎么被人正面碰过。 两年前我写过一句话,说INT4基本是把模型打回原形。
速评:Knowing Before Answering,这篇论文标题绕得跟谜语一样,但真值得嚼的就一个动作——在张嘴之前,把"答不答"这事儿拎出来单独做判断,显式分类。 RAG 这个圈的经典剧本,我看了差不多二十轮了:检索不行,那就换更大的模型来兜底。

速评:RAG防御论文今年出了一个共同前提——恶意文档带着查询痕迹,而查询痕迹能被过滤。CamoDocs直接挖的是这个前提本身:把有毒的东西伪装成正常内容,不要查询重叠也能打穿。 论文8月28日挂上arXiv,标题带“camo”也是挺会挑词的,伪装色嘛。

速评:这篇论文上周上 arXiv,我读了两遍,越读越觉得它根本不是来教你怎么修 hallucination 的——它是来告诉你,修这个动作本身就在折价,你只是有权挑一种折法。 论文做的东西不复杂:RAG 场景里,模型拿检索来的文档回答问题,还是会产生没依据的陈述。
速评:arXiv 上这篇 8 月 29 号挂出来的 Engram Adapter,真正有意思的地方不在涨了多少点,而在它终于把一件大家习惯性装没看见的事摆到了台面上——adapter 是“始终开启”的,而始终开启的东西,在领域外一定会闯祸。 这事在 PEFT 文献里其实一直是个半公开的秘密。

速评:这篇今天刷到我时间线上的论文,讲的是把图当成一种临时存储,而不是把整个知识库做成图。思路不新,上一波RAG图增强的浪就有人提过类似视角,但页面标题这行字才是重点——四作者,十三页,这不是那种团队作战的工程报告。 先摆数据:8月30号提交,挂cs.AI,到今天一周。

速评:这篇论文 8 月 30 号挂上 arXiv,到今天六天,我没见一个人把它真正值得聊的那句话挑出来。不是“9B 打平更大模型”,是题目里那个动词:Learning to Navigate。 它把 RAG 的语料观,从“平的”改成了“带结构、可以走的”。 框架本身不玄。

速评:又一份把agent拉回地面的论文,这次用的不是花活,是dependency hell。arXiv编号2608.30300,提交于三天前,标题起得倒是直白——《Update from Hell: Can Coding Agents Survive Hidden Breakage in Dependency U…
速评:8月31号挂上 arXiv、同时被 EMNLP 2026 主会收了的那篇仓库投毒攻击论文,我读完了第一遍就想说一句——这剧本,眼熟。 不是指攻击手法本身眼熟。第三方代码仓库里埋雷,这招在开源供应链安全里算是老黄历了,npm 投毒、PyPI 抢注,哪年不来几轮。

能憋出三千行前端界面的AI agent,现在多得跟外卖小哥一样遍地都是。但你要是让这些“可视化大牛”自己动手画一个简单界面出来,画面就尴尬了——不是码不对,是布局本身就是一团乱麻。 AMBench这篇论文,算是把AI编程圈的画皮扯下来一层:别看你码代码码得飞起,你脑子里那张画布,基本是一片空白。
速评:这篇 arXiv 论文把后训练称作“棕地维护”,我觉得是今年 AI 圈最诚实的一个提法。看着新鲜,其实只是把业内人人知道但没人写的东西说破了。
速评:Phidgets 在 2019 年 4 月发的这篇长距离 WiFi 测试,比最近十几场"颠覆式发布"加在一起都有参考价值。不是技术多新——2026 年看 2.4GHz 传 1400 米,确实不算什么——是它把话说到什么程度、边界划到多清楚,现在的通稿里已经绝迹了。
速评:这篇帖子最值钱的不是那条机械腿,是"手绘草图→Gemini出三视图→Opus按three.js落地"这条流水线本身。 Anna Villarreal 25号在dev.to发的这则更新,表面讲的是给桌面宠物Catbot升级机械腿的过程。实际上,她写下的是一份非常具体、可复制的"AI当翻译,不来当设计师"工作流。
速评:AMARG,地球上最大的飞机坟场,名字全称是"第309航空航天维修与再生大队"。殡葬部门管自己叫"再生",这不是语言粉饰,是运营定义——停在里面每架飞机都在排队等待重新处置,不是等着被悼念。这名字搁AI圈,简直是照着缺什么补什么起的。

速评:那个用pass@k给AI编码智能体刷分刷了快两年的玩法,终于被人写成论文扒了个底朝天。 论文是8月11日挂到arXiv上的,到今天19天,讨论度我体感不算热。

速评:调度器才是并行解码里拖后腿最狠的那个,没人看它。 这篇8月12号挂在arXiv上的dLLM解码方法,cs.CL,编号2608.11742,十个人署名,没喊任何“颠覆”口号——但干的事比同一天大部分通稿都有嚼头。它抓住的问题很简单:现有并行解码调度器,要等一个位置满足逐位置标准才提交。
速评:一个叫VITA的临床RAG系统,在HealthBench上把GPT5.4、o4mini、Gemini 3.1 Pro、Claude Sonnet 4.6全干翻了,51.9%对46.1%,领先最接近的对手快六个点。 先说清楚这玩意儿是干嘛的。