先说结论:方法方向我认,摘要话术打七折,绝对值缺位这一条先扣着不放。
9 月 16 号下午挂上去的,cs.LG 兼 cs.AI。PDF 九兆出头,TeX 源码都放了。到今天两天。MoE 剪枝这摊子,光把校准集在 122B 上跑通就得占掉好几天——所以这篇我还没跑。
今天这面镜子不照效果,只照摘要里那几处一眼扫过去很爽、逐字读会卡住的表述。效果留到有人复现出绝对值再说。
一句话交代它在干什么:现在的专家剪枝基本是给每个 expert 独立打分,把分低的剪掉。作者说这个假设是错的。专家之间有协作结构,得用二阶目标来抓。方法叫 HOPE。
好,开照。
「上界」
摘要原话:作者证明该目标「能最小化剪枝误差的一个上界」。
上界。
优化的是误差的界,不是误差本身。这话数学上没毛病——代理损失、凸松弛,整套机器学习都在干这件事,谁也没资格拿它说事。
但这么写有个后果:往下一层引用它的人,很可能把「一个上界」四个字直接吞掉,变成「HOPE 能最小化剪枝误差」。
差两个词。差的是一个证明的适用范围。
我见过太多次了。摘要里老老实实写着「上界」,半年后变成十篇博客里的「理论保证」。
「REAP 是 HOPE 的一个特例」
原文说的是:当忽略交互项时,当前先进的一阶方法 REAP 可被看作 HOPE 的一个特例。
这是我最想盯的一句。
这种包含关系在论文里基本等于免费广告位——把自己的方法和 SOTA 的关系写成「它是我的退化情形」,读起来就像已经赢了。
数学上成立我信。但这种关系是对称的:反过来,REAP 的作者完全可以写「我们的方法在交互项为零时等价于 HOPE」。摘要只写了一个方向。
我不是说作者有问题,学术写作天天这么干,谁不干谁吃亏。我想说的是同行的眼睛别被这个句式带跑——包含关系不携带任何实测信息。谁的实测好,跟谁是谁的特例,半毛钱关系没有。
「1.58」
50% 剪枝率下,HOPE 在 5 种方法里的平均排名 1.58,次优的 REAP 是 2.42。
5 方法中的平均排名
HOPE 1.58
REAP 2.42
好看。也很好看地没有信息量。
平均排名 1.58 和 2.42 的差,落在同一套基准上到底是 0.3 个点的困惑度还是 3 个点?如果差距集中在某个高剪枝率拐点之后,那它对绝大多数只在 30%~50% 区间动手的人就没意义。
排名是发布会最喜欢的那类指标——它把绝对数值藏起来,只留一个看着很有说服力的序数。
我要的是:剪完 50%,困惑度从多少掉到多少;agentic 那套任务的通过率从多少掉到多少。这些数字有没有在正文里,我还没翻完那九兆的 PDF,先别信我这半句。
还有个小地方。摘要末尾说「在大多数两两比较中胜过其他方法」——大多数,不是全部。这句话放在结论里显得很克制,但它和 1.58 那个排名并排放的时候,读者会自动读成「全面胜出」。差别在哪,不用我多说。
「最高 6.1%」
同一句话:在智能体编程任务上,HOPE 相比基线的提升「最高」达到 6.1%。
最高。
不是平均,也不是中位数——是这一堆实验配置里挑出来最好的那一个。厂商通稿这么写是要被挂的,论文里这么写是常规操作,这条我不算它的账。
麻烦在于,「6.1%」会和「平均排名 1.58」并排放进同一段摘要里。一眼扫过去,脑子里合成出来的是「HOPE 在智能体任务上平均提升 6.1%」。
不是的。这两句话差着十万八千里。🙃
「两个校准集」
实验用两个校准集。两个。
剪枝方法对校准集有多敏感,是这个领域最不体面的一块遮羞布。同一套方法,换一份校准数据,掉点能差出一个身位。「两个校准集都赢」这句话的信息量,完全取决于这两个校准集是什么。
一份如果是通用网页文本,另一份如果跟 agentic 编程那套基准的分布靠得近,那这个「都赢」的含金量得单独折算。
这个我确实不知道,得翻正文。但我在摘要里没看到任何关于校准集构成的说明,而摘要偏偏又拿校准集上的结果当卖点——这个组合有点别扭。
现在说好听的
不然这篇就成宣泄了。
这个方向我认为是对的,而且对了挺久。给每个 expert 独立打分再剪,等于默认专家之间的贡献可以相加——MoE 里最不值钱的一条假设就是这个。两个功能互补的 expert,你剪掉一个,另一个的激活分布会当场变味。
做 MoE 的人嘴上都知道。但剪枝工具默认的那套打分方式,这么多年就是把它们当独立个体处理的。
HOPE 咬住这个点,我不意外它能赢。意外的是这么明显的一项交互,一阶方法能占据主流位置这么久没人正面动它。
还有一条得给分:实验做到 122B,三个前沿模型,两个校准集,数学、指令遵循、编程、智能体四套基准。这不是拿个 7B 玩具刷个榜就发出来的东西。
顺手一提,v1 的提交时间戳精确到 9 月 16 号 16:55:46 UTC。这种精度本身说明不了什么。我当时想从提交时间反推它是不是赶某个 deadline 的三周速成品——推不出来,这条作废,当没写。
锐评评分卡
方法值不值得跟?值得。一阶剪枝的独立假设被正面撬了一次,这个动作本身有价值,122B 的规模也摆在那,不是 PPT。
摘要话术该不该打折?该打,至少三处:「最小化剪枝误差的一个上界」里的「上界」,单向表述的「REAP 是 HOPE 的一个特例」,还有「最高 6.1%」和「平均排名 1.58」被并排放在一起。三处都不算造假,三处都在往同一个方向使劲。
绝对值缺位这条怎么算?先扣着。基于排名的结论我一律不给分。等正文里的绝对数字,或者等有人复现出来,再回头看这篇。
现在要不要读?方法那几页可以先看,结论那一节先搁着。照旧,先测再信——只不过这次得等别人先测。
