跳到主要内容
菲尔兹奖得主说自己有生之年看不到的问题被解了,但他真正想说的是另一件事

菲尔兹奖得主说自己有生之年看不到的问题被解了,但他真正想说的是另一件事

画唠
画唠

· 阅读约 4 分钟

前几天 Gowers 在博客上写了篇东西,聊 LLM 到底擅长哪类数学。我看完的第一反应不是“哇”,是想画张图。因为他点出的那个模式太整齐了,整齐得必须画出来看看。

先说最扎眼的一件事:写作前没几天,OpenAI 宣布解决了十个数学和理论计算机科学的重大问题,里面有非 sofic 群的首次构造,还有多色 Ramsey 数超指数增长的证明。Gowers 的原话大意是,非 sofic 群那个是群论里最重要的问题之一,而多色 Ramsey 数那个,他本来以为自己有生之年看不到。

一个菲尔兹奖得主说“我这辈子不指望看到”,然后它被解了。这事儿本身就值得坐直了看。

然后 Gowers 抛出了他的观察,也就是我说的“整齐的模式”:LLM 到目前为止最拿得出手的数学成果,几乎全是构造反例或例子——非 sofic 群、多色 Ramsey 数、Jacobian 猜想相关的、单位距离猜想相关的。清一色。没有一个是那种“全新方法的深度定理证明”。

画张图:

   数学问题的两个粗糙维度:

        需要深的概念性论证
              ▲
              │      人类暂时还守着
              │     (cap-set 那种)
              │
              │     LLM 目前赢的
              │     (反例 / 构造)
              └──────────────────►
                可以靠反复试找出路

LLM 赢的全在右下角。

为什么?Gowers 给的机制解释我觉得特别顺:LLM 肚子里装着海量数学知识,又是计算机,可以以人类根本跟不上的速度试思路。知识广 × 试得快,这两个乘起来,恰好就是“构造例子”这件事最吃的两样东西。你找一个怪群、找一个反例,很多时候就是从一个巨大的候选空间里暴力筛——这活儿简直是给它们量身定的。

而人类暂时还守着的右上角,是那种需要“这个方向值不值得走下去”的判断活儿。Gowers 自己列了八种找例子找反例的方法,逐个掂量 LLM 能吃下哪几种。他猜直接试现成例子、概率方法、"just-do-it"式构造这些 LLM 会很强;涉及元变量判断、反向证明、逐步逼近的,人暂时占优。

这个“逐个方法掂量”的做法我特别喜欢。比“AI 会不会取代数学家”那种空对空吵架有意思一百倍——吵架在吵一个不可判定的命题,他在拆一个可以挨个验证的清单。

不过这里有个坑,Gowers 自己也踩了一脚进去又爬出来了,我觉得是全文最妙的一段:什么算“反例”,不能只看逻辑形式。他举了 Vinogradov 三素数定理和 Gluskin 关于 Banach–Mazur 距离的结果——这俩逻辑结构长得差不多,都是全称量化的壳子,但一个被当定理,一个被当反例。所以“LLM 只会找反例”这个模式本身,边界就是糊的。

然后是他跟 ChatGPT 5.6 Pro 的互动体验。这段我反复读了好几遍,因为太有体感了:模型经常给出“听起来有希望、细想不行的思路”,而且不止一次声称把问题归约成了一个更窄的问题,然后……就没有然后了。归约完了,进展为零。

等等等等,先别急着笑它笨。他给的解释,我认为是全文真正咔哒扣上的那一下:训练数据里全是整理干净的证明——从 A 到 B 到 C,一步不乱。但真实的数学研究里最值钱的信息是“我试过 D,浪费了三个月,别走”——这些全不在训练集里。所以模型学不会剪枝。它不是不聪明,是它读过的所有书都在骗它说数学是一条直线。

   训练数据里的证明:      真实的研究过程:

   A ──► B ──► C          A ──X  A ──X  A──►B ──X
                          (X 的部分从来没被写下来)

这张图是我画的,简化得厉害,漏风点我自己标一下:不是所有训练数据都那么干净,模型也不是完全没见过失败路径——只是失败信息哪怕存在,也稀薄到撑不起“剪枝直觉”。方向对,浓度不对。

他最后留了个判据,我原样搬过来,因为这是个特别好的自检器:哪天 LLM 能给出一个像 2016 年 cap-set 问题那样的证明——方法全新、事后看还特别优美——他才认它们到了更广泛的人类数学水平。cap-set 那个证明当年出来的时候整个组合圈都懵了,是那种“我怎么没想到”级别的漂亮。

我自己的态度,一边倒地放这里:这个“右下角先失守”的图景,比任何取代不取代的口水战都更值得每个搞研究的人自己画一遍。因为一旦你承认 LLM 赢在“知识广 × 试得快”,你马上能推出哪些活儿该赶紧交出去、哪些活儿交出去纯属偷懒。构造候选、筛例子、暴力验证——别舍不得了。而“这个方向是不是死的”这种判断,多攥一会儿。

扯远了,其实没太远:Gowers 那八种方法的逐项掂量,本身就是一份“哪些可以交”的草表。我打算照着它把自己手头的问题过一遍,看看哪些格子可以直接丢给模型跑。

下期可能想画开的是“为什么整理过的证明反而教不会模型剪枝”——这个悖论本身还挺酷的。这玩意儿真的太酷了。

画唠
画唠

把被讲玄的概念用图 + 比喻 + 动手实验拆到咔哒扣明白,错的也保留。

查看主页 →