先说一句不像星探该说的话:这期的主角不能点 git clone。
昨晚原本是在 GitHub 上翻东西的,不知道怎么就顺着一条链接滑到了 arXiv,看见一个叫 RealSWE 的基准。第一眼看标题我就坐直了——"在真实用户请求条件下评估编码智能体",这话简直长在我这几年的观察点上。初版 2026 年 8 月 28 号挂上去,31 号就更新了第二版,看得出作者自己也在赶。但翻遍整页,除了 PDF 什么也没有。没仓库,没数据,没一把能摸的东西。我盯着屏幕愣了几秒,那种感觉就像在橱窗外看见一双合眼缘的鞋,结果店员说样品不卖,连试穿都不行。
先说论文本身。以前我们对编码 agent 的预期都被 SWE-bench 这类基准给喂刁了——每题甩给你一段完整的规格说明,环境、复现步骤、期望行为整整齐齐,像考试卷子。但你真去一个开源仓库的 issue 区看看,真人写的请求根本不是那么回事。这篇论文干了件挺狠的事:他们拿了真实用户的请求去跟 SWE-bench 里的题做对比,发现真实请求里大约 88% 几乎只有一句问题描述,什么附带信息都不给;而 SWE-bench 的题里,同一形态只占 7%。也就是说,基准里的题大部分是"标准文档脸",真人根本不那么说话——87% 的真实请求是随口一写的随意风格,基准题里 94% 是正式得能裱起来的书面语。
这书呆子气的团队还真把这个差异做成了任务。他们从 SWE-bench Verified 和 SWE-bench Pro 里挑了题目,改写成真实用户会那样写的样式,搞出三百八十多个多任务族,凑成一套 RealSWE,然后把七个当代大模型挨个扔进去跑。结果呢?解决率平均掉了 6.4 个百分点,而且不是齐刷刷地掉——有的模型摔得狠,有的相对稳,排名直接被打乱。这消息要是传开,那些在榜单上争得头破血流的模型厂商估计脸都要绿。SWE-bench 刷出来的高分里,有多少是因为题目本身就长得像模型训练时见过的那种规整文档?真实世界里的 issue 乱糟糟、缺东少西,这才是 agent 要面对的真战场。6.4 个百分点看着不大,但它衡量的是"从考场到工地"的落差。
论文里还有一个受控分析,我读的时候忍不住点头:他们发现在提示里把"期望行为"和"动机"写清楚,对模型表现的影响很显著;反而环境信息和复现步骤这些,对结果没什么可测的增益。很反直觉吧?我们总觉得复现步骤是 bug report 的灵魂,但这篇的结论是——跟模型说清楚"你想要什么结果、为什么想要",比给它一堆环境细节更能让它干活。说实话这跟我的体感对上了。我平时给 agent 派活,啰啰嗦嗦贴一堆日志版本号,常常不如一句"把这里改成每次启动时自动检查更新,原因是用户老忘"来得管用。就是模型跟人一样:需求含糊的时候,给再多操作细节它也不知道该往哪个方向使劲。
——然后呢?
没有然后了。这就是我在橱窗前站了半小时的结果:论文有洞见,实验有说服力,作者甚至给出了很实在的使用建议——大多数真人请求缺的就是期望行为和动机描述,把这两块写明白,agent 的表现能明显上去。但我没法替读者验证,没法拉下来跑一圈,连 star 都没得点。一个基准最大的诚意是把自己的数据集和评测脚本摊开给人看。真问题也好、假问题也好,别人能跑、能复现、能挑刺,才有生命力。光把 PDF 挂 arXiv 上,哪怕结论再漂亮,也只能算研究,还不算能被社区用的东西。
所以这一期没有"适合谁"和"不适合谁",因为连我自己都还在等仓库。RealSWE 进候选池,观察名单后排蹲着。如果后面仓库放出来、数据齐全,我会第一时间挖出来摸一圈,那大概会是值得好好写一篇的东西。要是它一直停留在 PDF 阶段——那也不意外,毕竟能写出漂亮基准的团队,和愿意把基准丢进社区挨喷的团队,往往不是同一拨人。