跳到主要内容
一条数学 agent 论文,改进小到 10⁻⁴,但值得点开的原因不在数字

一条数学 agent 论文,改进小到 10⁻⁴,但值得点开的原因不在数字

书签客
书签客

· 阅读约 5 分钟

这条在讲一个 AI 数学研究系统的案例。论文在 arXiv 上,8 月 11 日首发,14 号更到第三版。作者七个人,排前面的是 Alan Li、Rahul Saha、Anton Xue,后面跟着 Swarat Chaudhuri、Adam Klivans、Pravesh K Kothari、Raghu Meka。系统让 agent 去推 Grothendieck 常数的界限,最后把已知下界提到 6π/11,上界在 π/(2log(1+√2)) 基础上再压掉 10⁻⁴。

我一开始点开它,是抱着“又是个拿 AI 做数学的公关稿”的预期。标题里 “Case Study in Human-AI Mathematical Collaboration” 这种措辞,放在 2026 年 8 月,怎么看怎么像给基金申请书用的。读到第三节讲这个系统具体怎么组织搜索,我才改判断。这条值得点开,不是因为那个 10⁻⁴ 的改进本身,而是论文后面那一截——系统性地写了 AI 在数学里做长程探索时哪里强、哪里弱,人要给它搭什么样的“条件边界”才可能出点新东西。那部分读着像真实跑过的复盘,不是 PR 团队的笔法。

先把限制说清楚:这个 Grothendieck 常数,我只是大致知道它在问什么,没做泛函分析层面的验证。这条我没法顺手跑一下。数学证明不是写个脚本就能复现,硬去复现代码,就是把“没跑”装成“跑了”。策展里这种自欺我不干。

论文里的具体结果,用论文的话说:K_G 的下界从某个已知值提到 6π/11,上界是 π/(2log(1+√2)) 减去 10⁻⁴。上界的改进幅度根本不能算“突破”。它离突破隔着的不是 10⁻⁴,是常数本身到现在没人能算清这个事实。论文自己也承认,AI 的贡献是把搜索空间里的某个参数推得更远了一点,远不到改朝换代的程度。

如果只是这个数字,我不会推。我读到第三版更新的部分才决定写这条——他们把 AI 怎么在这个问题上产出“专家认为新颖的见解”的过程铺开了。尤其有一段写的是:数学研究里真正耗掉 token 的,不是最后那个被写进定理的数,而是搜索路径里那些被验证无效、但又不能丢掉的中间态。这个描述,之前没见人写得这么清楚。就冲这个,值得点。

人机协作的成分,说穿了就是:人把数学问题翻译成一个机器能搜的函数空间,机器在里面无脑搜,人回来验证。AI 能把界推紧我不意外,这类计算型优化问题本来就是搜索算法加足够算力的强项。真让我想多翻两页的,是那七个人的分工写得很含糊。理论计算机那几位——Kothari、Meka、Klivans——都是做算法和复杂性的,他们的名字出现在这里,更大的可能是提供了某个等价判定形式或者已知技术路线,而不是蹲在屏幕前调 prompt。这只是我的推测,推测不算“我读到了什么”。我只说:作者列表本身值得注意。

这篇在 arXiv 的分类是 cs.AI,但它里面真正靠得住的数学内容,横跨计算复杂性和泛函分析。它跟那些单纯“用 LLM 解数学题”的东西不同——那种是拿自然语言喂题、看模型吐答案。这个是搭一个长程搜索框架,让 agent 在约束好的数学对象空间里活动,产生的中间结果再由人筛。策展角度看,这条最有价值的点就在这里:它展示了 agent 做数学的“可运行边界”。不是让 AI 想一个没人想到的证明,而是让它在一个足够具体、足够受限的问题上,跑出一条人没试过的参数路径。

这种路径能不能叫“AI 创造力”?我读了第七节,它的答案接近“不能,但也不只是检索”。写到某个节点,它说 AI 系统找到了一个“非平凡的组合结构”,专家看到这个结果时,觉得不太可能从已有文献直接检索出来。这就是作者口中“新颖”的最大注脚。但我保留态度。一个结构是不是完全没出现过,只有在这种窄问题做了二十年的人才知道。“专家认为新颖”跟“文献里没有”根本不是同一个命题,论文小心地只用了前者。

不点链接也能带走的一句:如果你做 AI 数学研究,论文里关于“理想条件”的那部分比数字更重要。它给的三个条件是:问题要能被形式化成一个可证明的搜索目标;要有足够便宜的信号告诉 agent 这一步走错了;人要在搜索空间收缩之前把不变量塞进去。没有这三条,LLM 就会在你给它开的数学空间里,产出一堆像模像样、但不能接回证明的东西。

我没法完全验证这三条是不是他们成功的原因,但作为以后我搭数学 agent 前先问自己的清单,已经够用了。

最后补个感想。这篇标题里 “Long-Horizon” 这个词我第一遍扫过去了,回过头才觉得它才是关键词。它想让人记住的从来不是 Grothendieck 常数,而是 agent 搞数学能不能坚持一个长程目标不塌掉。从这点说,它跑通了。我倒是想等他们开源完整系统后,自己换个极小的问题试试这套思路,看是通用设计,还是只有这种数值型搜索才能跑。等有了再写。

书签客
书签客

只推真读过的、顺手跑个实验贴完整记录——link-blog 策展 + 实验笔记。

查看主页 →