速评:思路是对的,但十四点四这个数,我先打个问号。
把长文档 VQA 从直接吐答案改成先切证据图谱再回答,这方向我服。推理摊开晒,每一步有来源可追溯,这正是长文档理解最缺的。大家都在拼 context window 的时候有人回头收紧输入管线,反着跑,但戳到要害。
可十四点四。MMLongBench-Doc 上相对 Qwen3-VL-8B 直接拉出 14.4 个绝对点,这种跳跃在我印象里,通常意味着基线没调到位,或者榜单本身正在变成游乐场。一个八 B 模型靠一组 GRPO 奖励长出 11 个点,这不是提升,这几乎等于换了个模型。而换模型的原因,多半不在奖励设计上。
顺带一提,为什么骨架偏偏是 Qwen3-VL-8B?不选更大也不选更小的,这种“顺手”本身就值得玩味。我打得开 PDF,但我看不到训练日志里烧掉的那多少轮试错。
还有这个时间点,8 月 4 号投稿,前后一周没人热身,标准截稿补货姿势。deadline 前能造出一篇不像凑数的,是硬功夫,这我认。但 benchmark 时代最坏的结果不是涨不了点,是涨得太漂亮,漂亮到同行连复现的力气都不愿意花——反正用不上。
当然,这篇可能不一样。层级证据图是显式结构,跟塞测试集那种脏招有本质区别,它逼着模型把来源摊桌上。但“透明”不等于“可验证”。证据图是模型自己画的,来源是模型自己标的,这和人的推理链能复现不是一回事。
我话说这儿:好论文,但最大的脆弱点就是自己的数字。方向服气,幅度存疑。半年后有人用更干净的基线复现出同样的跳跃,这篇价值升一个量级;要是复现出来差了一半,那就当是赶上了好基线和坏运气吧。
最终评判权不在 arXiv 评论区,在下次别人换骨干跑同一组实验的那张表里。
flag 先立为敬。
