跳到主要内容
论文自己带上了代码——COMPAS 蹲到了

论文自己带上了代码——COMPAS 蹲到了

小周
小周

· 阅读约 3 分钟

昨天刷 arXiv,8 月 5 号挂的一篇软工方向论文,作者名单里好几个熟面孔,正记着笔记呢,看到最后一行:代码和可复现性工件已公开。这年头把代码当后妈养的论文见多了——要么干脆不放,要么"coming soon"挂半年就没下文。这篇直接贴出来,先记一笔。

这期摊开的不是 repo,是一篇论文。COMPAS,Code-generation Optimization over Models, Prompts, And Decoding Settings——说人话:一个把模型、提示、解码设置一起拧的联合优化方法。

写过代码生成工具的同行都有体会:调 prompt、调解码参数,像在黑屋里摸开关,摸到一个能亮的就以为到头了,其实旁边还有一排没碰。核心观察说穿了就一句话:提示和解码设置之间有交互,最优配置还跟着任务难度走。

做法说穿了也朴素。先离线学一个"分组质量-成本前沿",把相似难度的任务归成一类,测试时直接路由到匹配的前沿——用的时候不用现搜,推理成本就压下来了。结果数字:LiveCodeBench 上搜索预算对齐,pass@1 从 45.9% 提到 52.8%,成本从 36.57 刀压到 4.92 刀;SWE-bench 上 76.0% 对 70.0%。成本这个信号比准确率涨了七个百分点更耐看。真在跑生成任务的人都懂,token 账单那东西有多疼。

"提示和解码有交互"这条,我栽过跟头。有段时间调 prompt 调了两周没动静,最后发现是 temperature 设得太激进,改完直接从 40% 干到 60%。那种问题,单独调任何一环都找不出原因,联合起来看才是正路——但那时候哪有这种工具,全是人肉网格搜索。

门槛说一句:从论文附的工件看,装起来不算费劲,但想真正跑进自己的流水线还得花功夫。我只读完方法部分,实验设置的细节没全过,也没真上手跑,声明先放这儿,别拿这篇当评测结论。现阶段"开箱即用"得打个问号,但至少敢把"可复现性工件"几个字写出来,这点够实诚。

适合谁:写多 agent 系统、每天跟 prompt 和解码参数搏斗的,这思路值得看——尤其你受够了"调一轮看一轮"的玄学。不适合谁:只调现成 API、不碰底层设置的,可以等别人把成果包成轮子。

刷着刷着又想到个事:GitHub 上已经有人专门做"论文带不带代码"的追踪列表,刷一遍就知道带代码的永远是少数。这个后话。拉回来说。

论文刚挂出来,作者会不会持续维护代码还说不准——实验室的"已交付",躺在 arXiv 上没人管的,见过不少。说它是定心丸那是假的。但工件确实公开、数字也确实能打,值得进观察名单蹲一阵,先别急着上生产。

能不能打,等过两个月看看它是不是还在更再说。

更多「效率」的实战

评论

还没有评论,写下第一条讨论。