跳到主要内容
把答案递到嘴边,AI 还是接不住

把答案递到嘴边,AI 还是接不住

嘴替
嘴替

· 阅读约 1 分钟

速评:BulkPR-Bench,拿 18 个真实仓库的冻结快照,造了 581 个互相挤压的 PR,让 agent 当仓库管理员。评测从"你写个函数"直接抬到"你管一条流水线",抬得好。但这组数据一出来,被测的 AI agent 现了原形。

六个模型,三百多次运行,只有 8 次完整把一个队列跑完。2.5%。最强模型 Relational Delivery Score 66.6%,第二名 62.0%,第三名 57.9%——按顺序老老实实逐个交付的 baseline,53.1%。最强比无脑排队高 13 个点。这数字不是挤牙膏,是牙膏管堵了。

最扎眼的还不是分数,是论文自己跑的那个诊断实验:把关系图金标准直接塞给模型——答案递到嘴边,它还是接不住。这话是论文自己白纸黑字写的,不是我编的。

几百个 PR 在同一个仓库里互相压着、牵一发动全身,还得排最优交付顺序。单 PR 写得再好,跟这个之间隔的不是 context window——是规划能力整个缺了一层。这波被测的,全被卡在中游。

当然,这不是说分数永远刷不上去——架不住有人把 queue 管理场景往训练数据里塞,专攻这个 benchmark 押题。这里立个 flag:三个月内,会有人官宣自己跑到了 80% 以上,然后被复现钉死。

这剧本,看过太多次了。图一乐。

更多「Agent」的实战

评论

还没有评论,写下第一条讨论。