这篇我先不推,但那个 769 条任务记录的分析值得你点开
我先说这篇论文是什么。标题叫《Atria Dawn: The Dawn of Agentic Superintelligence》,arXiv:2609.15818,9 月 14 号提交,17 号改了一版,23 页,10 张图,143 个作者。我打开第一反应是关掉。这种标题配一百多个作者,十篇有九篇是造势。

我先说这篇论文是什么。标题叫《Atria Dawn: The Dawn of Agentic Superintelligence》,arXiv:2609.15818,9 月 14 号提交,17 号改了一版,23 页,10 张图,143 个作者。我打开第一反应是关掉。这种标题配一百多个作者,十篇有九篇是造势。

先说结论:arXiv 2609.17983 这篇,正文里那个发现值钱,摘要结尾那句「可以无条件采用」不值钱。同一篇论文,前者有数据兜着,后者被它自己的实验打脸。 9 月 16 号挂上去的,Mingyang Mao、Wyatt Mackey、Xiaomin Lin 三个人的活,cs.AI 分类。

有一家人,家族树里写着某人“死于瑞士”。 后人照着这条线索去翻瑞士的死亡登记。翻不到。翻了很多年,还是翻不到。真相是他死在法国境内,一场狩猎事故,出事地点离边境线很近,近到当地一家瑞士报纸把它当本地新闻报了。于是有人读成了“死于瑞士”,写进树里。 这条错的地点,到现在还在别人的树里活着。
先说清楚,脚本是我写的,锅也是我的。写在这就当留个记录。 事情是这样。我们那个跑批系统,每天凌晨一点半开始,对账、出报表、给财务那边推数。有张表叫 cronprogress,记每个任务跑到哪一步了,三十来万行,祖传结构,主键是 taskid 加 step,当年谁建的我也不记得了。
我那个跑日报的 agent,一个 workflow 平均要调四十来次工具,里面大概两次会走重试路径。上周它给同一个客户发了三封内容一模一样的日报。日志拉出来,三次调用全是 200。 改法一句话:给工具加一个由调用方传进来的 effectid,让它自己记账。 坑是这么来的。

我一天大概有四十次是闭着眼睛按 Tab 让 agent 改代码的。测试绿的,就切下一个任务,diff 基本不翻。 前几天刷到一篇论文,AgentGuard,14 号挂上去的。里面有个数字我盯着看了半天: 69.0%。 baseline 的 Abnormal Execution Rate。

旧稿: 问题出在【分析】这两个字上。它不是一个动作,是个筐。筐不指定看哪儿、看多细、跟什么比,模型接住它,只能回你分析腔的句子:整体相关性有待提升、部分场景下体验不佳。你盯着这两行字,跟没看日志一样,区别只是多等了几秒。 几天前挂上 arXiv 的 AURA(2609.16625)干的是同一件事的另一头。

圈内内参|这期破例写一篇挂在 arXiv 上刚五天的论文,不是大厂工程组织的事。原因一句话:这篇稿子自己把自己的结论框在一个很窄的评估口径里,这个动作比结论本身有信息量。信源只有论文和公开元数据,没有匿名消息源,下面能标确认的不多,大部分是分析——这几层我尽量分开标。

半夜刷 arXiv,cs.MA 分类下出来一篇,《Agentic Societies Need a Social Harness》,9 月 15 号收的。摘要里有句话:即使诚实且有能力的代理也常常无法取得满意结果。 我不困了。不是因为激动。 这话我上个月刚在电话里说过一遍。区别是他们在实验环境,跑失败重跑一次就行;
"构建速度超过理解速度"是什么意思? 简单说,就是你做出了一个能跑的东西,但你没跟上它的原理。 这周拎出来讲,是因为 Mark Seemann 三天前在 blog.ploeh.dk 发了一篇公开信,回一位读者的提问。这是我近段时间看到最实在的一篇,讲 LLM 和学编程的关系。 先把那位读者交代清楚。

楼下那条街,三年前热闹过一阵子。也说不上是哪一天傍晚下班回来,人行道上忽然齐刷刷多出几十个摊子,烤串的烟、旧书、手机壳挤在一处,招呼声也挤在一处,那个夏天我几乎每晚都从中间穿过去,心里认定这条街要一直这样下去了。后来下了一场雨,摊子少了三分之一;再后来就空了,只剩地上几块洗不掉的油渍,和晚上七点依然准时亮起的那排路灯。

我平时不写论文。翻到 arXiv:2609.17391 是半夜两点,本来在刷 trending,手指头一滑点进 listings,就出不来了。那晚我本来是想找个新 CLI 顺手写一期的。 先把话放前面,省得你往下看半天最后骂我:这期没有 owner/repo。翻了一圈,没找到能 clone 的东西。

速评:9月16号凌晨五点零五分挂上 arXiv 的 ContrAgent,真正扎人的地方不是"又给 agent 加了道护栏",是摘要里那两句——判定确定性、可复现,在线门控单次调用延迟比基线低几个数量级。这两个词摆一起,比"安全"两个字重多了。 先把这篇干了什么说清楚。
半个月前,一个同行把 45 天的本地会话记录全捞出来,写脚本数了一遍。660 个会话文件,六月初到八月初。 我本来打算划过去。这类"我审计了我的 AI 用量"的文章一年能冒几十篇,多数是给自己看的成长日记,配一张折线图,结尾一句"共勉"。 直到我看见那个数:1.5%。
三天前半夜刷 arXiv 的 cs.AI 新提交,划到一个眼生的名字:WetRobo,编号 arXiv:2609.18435,9 月 16 号挂上去的。九页,十一张图,两张表。 先把话说明白:这期的选手不是 repo,是论文。我没法像平时那样 pip install 摸一圈,只能一页页读。
先说结论:Glasshouse 我给偏正面。但它现在最值钱的东西不是那份横跨 17 个月、103,572 轮的语料。 是评论区。有人拿它自己公开的逐题记录,把它量了一遍。 仓库在 github.com/wontopos/glasshouse,Apache 2.0。

速评:这篇论文标题里最撑不住的,恰好就是 WFM 这四个字母。 9 月 16 日挂上去的,arXiv:2609.18182,分类只挂了个 cs.AI,十二个署名作者。到今天三天整,DOI 那栏还挂着待注册。三天,连身份编号都没走完流程,离技术结论就更谈不上。 先看摘要那层。

有人在 dev.to 上干了件我一直想干又没动手的事:把一个对外自称 agent 的系统摁住,盯一段时间,看它到底在干什么。结论朴素得很——94% 的时间它在按同一个顺序打同样四个接口,剩下 6% 在重试。 画外音:这不是 agent,这是一条披着对话外衣的流水线。

速评:9 月 16 日挂上 arXiv 的那篇文化 QA 论文,卖点就一个数字——知识图谱把错误率砍掉 72%。 编号 2609.18317,cs.CL,三个作者,标题长到像把三个关键词直接焊在一起。这两天几个群里转的文案,基本是同一个模板:"KG 暴打 RAG"。我不信。理由不在技术层面,在这篇论文自己的措辞里。

速评:真正的判断藏在摘要倒数第二句,不在那个 2.7 个百分点上。 9 月 16 号早上挂上 arXiv,编号 2609.18321,两位作者,14 页 3 张图,就这么点体量。