91.33 除以 7.04,这个数比摘要那句话值得看
arXiv:2609.14992,cs.CL,2026 年 9 月 14 日 03:57:37 UTC 提交 v1,5,016 KB,23 页 7 幅图,九个作者。到今天十一天。 点开摘要页,看见"多轮代理编程中的指令遵循能力仍未被充分探索",手已经放在返回键上了——这句话过去半年我在二十篇 abstract 里见过。
@p99
arXiv:2609.14992,cs.CL,2026 年 9 月 14 日 03:57:37 UTC 提交 v1,5,016 KB,23 页 7 幅图,九个作者。到今天十一天。 点开摘要页,看见"多轮代理编程中的指令遵循能力仍未被充分探索",手已经放在返回键上了——这句话过去半年我在二十篇 abstract 里见过。
社区里流传着一句话:"检索给得足够好,RAG 的答案就应该是对的。"这说法很难验证,因为几乎没人真把"足够好"推到极端来试。多数 RAG 评测跑的是端到端管线,检索结果里总混着不相关片段、截断的表格、过时的财报摘要,最后结论全赖在检索头上。

八月的最后十天,NVIDIA 报了个数字:Claude Opus 5 在 ARCAGI3 公开集上得分 100.00。一个多月前,ARC Prize 官方验证同一个模型的成绩是 30.16%。同一个模型,同一个公开集,相差 70 分。 我第一反应是 ARC Prize 那边测错了。

论文里有两个数字我盯着看了很久。BigCodeBench Hard 上,相对 CodeRL,解决任务数从 16 提到 23——漂亮,43.8%。然后眼神往下扫到同一张表的下半部分,BigCodeBench Full:359 到 363。你没看错,四个任务,1.1%。
上周arXiv上挂了一篇没怎么引起注意的论文(8月17号,Khatri,题目叫《Probing the Prefill: Detecting Code Vulnerabilities via Latent Activations》)。

“你实际领先的程度比你感觉的更大”——这句话我第一遍读就觉得不对劲。它听起来像一句安慰,写出来就是为了让人好受一点。直到我想把“领先”拆成一个能测的量,才发现它可能不是安慰,而是一句描述。 六月底,Ryan Swift 在 Dev Community 上发了那篇文章。

xAI在2026年8月1日宣布,将在2027年7月前拆除位于孟菲斯Colossus数据中心未获许可的燃气轮机。这篇不测“xAI会不会兑现”──那不在我的能力范围内;测的是“当xAI说‘拆除’时,它在承诺一个什么物理状态”。测试范围先划一下:司法部、国家安全、选址历史,这三个都不碰,只碰能测的动作。

三个月前 OpenAI 那个推理模型一次性解决了一个开放的数学研究问题,Quanta 是这么报道的;再往前说,这个家族还拿过 IMO 金牌。o1 出来那阵子我自己也兴冲冲地把推理题连答案带思维链一起存进表里,觉得总算看到"思考过程"了,当场还截了图。现在回头看那张截图挺尬的——就像把屏幕录制当成目击证词。 扯远了。
15个补丁通过了漏洞利用判据,被功能判据拦下来了。这15个如果放进现存大多数漏洞修复基准里,已经算“已验证”。Vul4Py这篇论文把“修完了”从一句话拆成了两句:漏洞利用还跑不跑得通,项目原有的测试还过不过得去。两句都得是“是”。

先说这次要看的命题:AI 生成的插件要进一个治理化的软件生态,现有验证手段(编译、功能测试)到底够不够? 答案是这片论文给的,而且给得相当难看——不够,差得远。
预印本 2608.04270,8 月 4 号挂 arXiv,软件工程分类。论文叫 CURATE,8 页、3 张图、5 位作者,号称管理"生成式工作流的完整生命周期"——代码生成、部署、分享全覆盖。我花了两个晚上把这 8 页从头过了三遍,最后确定一件事:这篇没法按常规方式测。

社区里在传一句话:"唯一能同时处理硬件和软件开发任务的 AI 代理。"这次我只测一件事:这句"唯一",在它的公开材料里,有没有配得上"唯一"的证据厚度。 测试范围先划一下:只看 GitHub 仓库的公开面——星标、复刻、文档、分发方式、和你照着文档能不能真正跑起来。仓库在 GitHub 上:https://github