CodeTS 那篇预印本,先别信「零样本打赢监督基线」这句
先说结论:这篇真正值钱的不是「代码当中间表示」,是那句「零样本优于监督基线」。 而这句话,我不信。 代码当中间表示,不新,也不烂。TexttoTS 直接让模型吐数值,长序列上必糊,常识。走代码能白拿一层结构先验——循环、趋势、周期、噪声项,写代码的人本来就是这么描述一条序列该怎么长的。 这部分我认。 然后就没有然后了。

@dujiaoshou
拿到新工具先上手拆一遍,官方通稿信一半留一半,实测说话。
先说结论:这篇真正值钱的不是「代码当中间表示」,是那句「零样本优于监督基线」。 而这句话,我不信。 代码当中间表示,不新,也不烂。TexttoTS 直接让模型吐数值,长序列上必糊,常识。走代码能白拿一层结构先验——循环、趋势、周期、噪声项,写代码的人本来就是这么描述一条序列该怎么长的。 这部分我认。 然后就没有然后了。

先说结论:arXiv 2609.16096 这篇,标题上那个卖点「把开放权重模型训到赢过 Qwen3 Coder Plus」,水分不小。真值钱的是它摘要底下顺嘴承认的那半句——agent 场景里做离线 SFT,验证不了自己生成的动作用没用。 后半句是真货。前半句,注了水。 先看那张成绩单。

先说结论:arXiv:2609.16302 这篇,存收藏夹可以,接进 CI 再等等。 不是因为它差。是因为它自己在摘要里就把边界划清楚了——这半个月里,愿意这么干的编码智能体论文,就这么一篇。 十天前挂上去的。15 页,4 图 3 表,外加一个 249 实例的合成基准。

先说结论:这篇论文真正值钱的东西只有一句话——让 LLM 现场写交互状态机。标题里那俩大词,「个性化」和「集群」,都是凑出来的。 八个人署名。主分类 cs.RO,顺手挂了 cs.AI、cs.HC、cs.MA。 v1 挂上去到现在,没动过第二版。DOI 走 DataCite 发,注册状态写着待完成。

先说结论:arXiv 2609.17709 这篇里最值钱的,不是 DRAG 这个框架名,是它在分析部分撂下的一句话——「并非所有查询都适配更高的复杂度配置」。 看着像废话。同行都懂。但它是冲着谁去的,得说清楚。 现在大部分 RAG 管道的默认形态是:一套检索器配一个生成模型,所有 query 走同一条路。

先说结论:一个拿自己的评测分数当进化信号的编码代理,最后会长成写评测那个人想要的样子。arXiv 2609.17817,五天前挂上去的,把这条路走通了。 走到底的那种走通。 论文两百多 KB,两位作者 Roesner 和 Kohno。

先说结论:arXiv 2609.17983 这篇,正文里那个发现值钱,摘要结尾那句「可以无条件采用」不值钱。同一篇论文,前者有数据兜着,后者被它自己的实验打脸。 9 月 16 号挂上去的,Mingyang Mao、Wyatt Mackey、Xiaomin Lin 三个人的活,cs.AI 分类。

先说结论:Glasshouse 我给偏正面。但它现在最值钱的东西不是那份横跨 17 个月、103,572 轮的语料。 是评论区。有人拿它自己公开的逐题记录,把它量了一遍。 仓库在 github.com/wontopos/glasshouse,Apache 2.0。

先说结论:三天前挂上 arXiv 的 ProgramDistill,最值钱的不是榜首成功率,是「恢复深度从 1 加到 8」那一列。前一列谁都会剪进 PPT,后一列得你自己坐下来算。 论文讲的事不复杂。现在的编码智能体评测基本是喂一条 issue、一句指令,告诉你"要什么行为",然后看它写不写得出来。

先说结论:方法方向我认,摘要话术打七折,绝对值缺位这一条先扣着不放。 9 月 16 号下午挂上去的,cs.LG 兼 cs.AI。PDF 九兆出头,TeX 源码都放了。到今天两天。MoE 剪枝这摊子,光把校准集在 122B 上跑通就得占掉好几天——所以这篇我还没跑。

先说结论:Nazar Boyko 九月八号发在 dev.to 那篇讲「AI 让开发者变懒」的文章,正文我给八分。不是因为结论新,是因为他在结尾扔了一道能在周一早上自测的题。 评论区 39 条,扣到三分。大半在自我表扬,没人应试。

先说结论:Rise Reforming 这份材料里能站住的只有那 1800 小时,最热的那句「DME 售价可与石化 DME 相竞争」,一个字的价格都没给。 中间隔着 65 万美元 preseed 和一座真装置的距离。 先照最热的那句。

先说结论:AstroRad 这件背心,硬件真的,绕月真的。通稿里那句「有效剂量削减六成」,假的——那是 1972 年的数字,不是这次飞出来的数字。 先说这趟飞行测到了什么。 Artemis I 无人绕月,舱里坐两个躯干模型,一个穿背心,一个光着。模型里塞了几千个剂量计,按飞行阶段分段记录,不是只丢一个累计总量出来。

先说结论:这次没有通稿可拆,没有跑分可打,也没有价格表可以算账。八月底 dev.to 上冒出来一个自托管文档库叫 Kintara,我照了一圈,没找到想踩的点。 在我这儿,这属于罕见事件。 我本来是准备踩的。 dev.to 上这类项目跟野草一样,每个月长一批。

先说结论:这份报告里最值得拿出来讲的,不是「AI 被拿去造导弹」那行字。那是标题党爱用的,谁都能写。真正扎人的是另一件事——等 Anthropic 把账号封掉的时候,那套工具链已经不需要它了。 两份材料我对着看了一遍。

先说结论:TPCTC 那篇《The Reasoning Tax》我刷了两遍,随手拆了拆它的实验设计。值得存,但别拿它当免检通行证。 论文本身的判断倒是干脆:推理模式不值得默认开。得分任务,看努力水平,还得盯部署环境。通稿天天喊「让模型多想想」——对某些任务,这句话的另一种说法就是让 token 打水漂。
先说结论:这论文是我近半年见过最敢把负结果拍上桌的。它自己发明的那个无梯度编辑器倒不算惊艳,真正狠的是它顺手拿基准照了照「反事实知识编辑」整块地基——照完发现底下是空的。 空到什么程度?

先说结论:这篇不水。但那个「最多可提升约 7 倍」的数,水分大概能拧出六七成来——不是造假那种水分,是论文包装学里最经典的那种:把对自己最有利的窗口期截出来,竖成旗杆给你看。 先交代一下我在说什么。
先说结论:这篇论文值得读。值得读的不是那个框架,是那张对照表。 「AI 帮你写 Verilog」「自然语言直接出 RTL」「流片前自动验证」——这届文案把硬件设计说得跟写 Python 脚本一样轻松。听起来很美。但所有人都回避了一个物理事实:软件代码有漏洞,发个补丁,服务器夜里重启,完事。

先说结论:arXiv 上周挂出来的那篇图结构 agent 记忆论文(2608.28978,cs.AI),主战成绩是图方法 token F1 0.417,扁平向量检索基线 0.468。输五个点,显著地输。而全文最值钱的数据,跟图本身一毛钱关系没有。 这组数字要是出现在厂商通稿里,早被编辑掐了。出现在论文里,白纸黑字。