9 月 14 号挂上 arXiv 的一篇论文,我拖到昨天才翻到最后那页结果表。
45 个数据集,平均相对增益 0.6%。
我盯着这个数字看了半天,然后把它抄进了周报。
——主要是因为它小得足够真实。
在表格这块混久了会得一种职业病:看数字先看它体不体面。凡是张口就报两位数提升的,翻它 baseline,十有八九是拎了个没调过的 GBDT 在那顶着打;0.6% 这种,一看就是跟调好的对手正面碰过的。
这套判断标准我用了三年,救过我不少次,副作用是显得很不合群。
我为自己的这个判断踏实了三秒,接着为"我居然在为一篇论文的数字诚实而感动"这件事,感到一点悲凉。
论文叫 Agentic Search Spaces for Tabular Machine Learning。做法朴素得不太像这个年份该有的东西:把表格模型拆成预处理、嵌入、架构、训练、推理几块,让 agent 给每一块写几个候选实现,然后——用最经典的 HPO,把这些候选和模型自带的默认超参丢进同一个池子里搜。
请记住这个分工。
Agent 不炒菜,agent 只负责把菜单加长。
【灯光打在菜单上,后厨里是 LightGBM 在颠勺】
我是真心服这个分工。过去两年,"让 agent 从零设计一个模型"的活我看过不少,结局高度雷同:吐出来的东西结构上挑不出毛病,注释写得漂漂亮亮,一跑起来像随机数生成器。
这回最后拍板的那一步,交回给了一个不会写小作文、不会自信地胡说、只会老老实实数数的东西。
最出彩的角色,居然是全场最无聊的那个。这是全篇我认为最正确的决定,比那 0.6% 重要得多。
另一个数,2.0%。论文写的是"小型到中型回归数据集"上的平均相对增益。
"小型到中型"是论文自己划的。
你没做错什么,任何人的论文都会挑自己最好看的那一格发出去。我写周报也这么干:五个指标里涨的那个加粗放正文,跌的那个塞附录,附录字号调成 8 号,底下还缀一句"该指标受数据波动影响较大"。
(这段是我瞎编的,我没写过这么细。但你是不是觉得很代入。)
顺嘴说,45 这个量级也很微妙。看着像认真做了,又不像在刷,刚刚好卡在"够用"那条线上——多一个不嫌多,少一个审稿人就要问了。
TabArena 那段是全文最硬的:五个模型族里四个的官方 Elo 涨了,还说最强的两个 agent 集成方案,超过了由常规模型凑出来的最佳 AutoGluon 集成。
"最强的两个"这个前缀,我得停一下。
锦标赛里能派几个选手入场,这件事本身就影响最后谁能夺冠。这不是这一篇的毛病,是所有"我们的最好打赢了他们的最好"式结论的通病。看见就当看见,别往心里去。
真正让我把这个标题记下来的,是那句"没有带来额外调参开销"。
这话看着平平无奇,实际是这几条里最难做到的。扩大搜索空间,原理上几乎不要钱,多写几个候选的事;实践里几乎一定要收税——每多开一格,预算就得多分走一份,原来那些好点立刻就不搜了。
所以每次看到"空间扩了但没变慢",我第一反应都是去翻它的预算口径,多半能翻出点什么。
这篇没在这上面耍花招:同样的调参预算,同样的集成预算,扩出来的空间仍然赢基础空间。翻译一下——agent 提的那些候选实现,不是把可选区域铺得更大,是把可选区域整体挪到了更肥的地方。
这跟"多试几个"是两回事。多试几个是买彩票,挪区域是知道奖池在哪。
哦对,论文说的是 45 个数据集里"几乎"提升了所有模型族。它写的是"几乎",没写"所有"。
这两个字的含金量,写过论文的人都懂。
打住,我本来还想讲讲预处理模块那块——那个其实也挺有意思,但我发现我想说的其实是另一件事,那就下次再说。
最后泼一盆我自己都不太愿意泼的水:离线涨 0.6%,和线上涨 0.6%,中间隔着一条叫"老板批不批这个 AB 实验"的河。论文里的 0.6% 是前者的 0.6%,这没问题,也够我抄周报了——但谁要拿它去立项一个季度的人力,那是另一回事,那是另一个段子了。
顺便,PDF 才 477 KB。我没别的意思,就是觉得一篇能让我抄进周报的东西,比我手机里一张截图还轻。这个观察有点冷,你们自己脑补笑一下。
(友情提示:本文不构成对这篇论文的评分,也不构成"你也去装个 agent 调参"的号召。0.6% 我是真会要的,但麻烦别让我为它写一份二十页的立项说明。评论区扣个你上次抄进周报的数字,我不信只有我这一个是 0.6%。🫠)