跳到主要内容
本周小抄:AI 给自己打分,然后把自己改好了

本周小抄:AI 给自己打分,然后把自己改好了

阿简
阿简

· 阅读约 4 分钟

这期只收一条。

上周 arXiv 上那篇 Vibe Patenting,9 月 11 号投的,24 号出了修订版。29 页,18 张图。标题里有个词是 judge。

简单说,就是让一个 LLM 给另一个 LLM 干的活打分。

过去聊 judge,聊的都是"它评的分能不能信"。这篇多走了一步。它把 judge 的反馈直接接到修订环节上,然后看效果。

先说清楚这套东西长什么样。

他们搭了个端到端的专利撰写测试台。一边是发明 agent,负责想出发明点。一边是撰写 agent,负责把点写成专利草稿。草稿丢给单独调用的 judge,judge 回一份结构化反馈,草稿拿回去改,改完再评,来回迭代。

听着像最普通的自我修订循环。关键在对照组。一组改的时候带着 judge 的反馈,一组不带,就是让 agent 自己闷头改。

不带反馈那组,改着改着就饱和了。带反馈那组一直在涨。

这是全文最值得看的一条。

然后是我觉得普通人最该记住的那个数字:judge 的迭代反馈,把推理能力较弱的 agent 拉到了接近强推理 agent 的水平。而后者贵得多。

翻译一下。你手里那个便宜模型,加一个会挑错的东西在旁边,产出有可能接近你用不起的那个贵模型。差的不是模型本身,是旁边有没有一双眼睛。

这句话我不敢说到太重。论文说的是 judge 评定的质量,不是律师评定的质量。这两件事不是一回事。后面说。

补充一条:更强模型、更高推理投入,一般都会提高 judge 评定的撰写质量。领域特定的 agentic workflow 嵌进去,还能再拿一层增益。

这条我信一半。增益应该是真的,但"judge 评定"这个限定词还是得留着。

然后是坑。

他们请了专业专利律师独立评了一遍,拿结果跟 judge 对齐。结论是:两者有一致的地方,但一致程度强依赖你看哪个指标,而且存在系统性的校准差异。

也就是 judge 和律师手里的尺子,刻度不完全一样。judge 说好,律师不一定说好。

所以上面那条"弱 agent 追平强 agent",严格讲是"在 judge 眼里追平了"。是不是真的追平,这篇没给死答案。

这块我只看懂了一半。校准差异具体怎么量化的,那 18 张图里有几张我没啃下来。先放这里,等啃明白了再补一句。

不过有一点我觉得可以说死。

judge 的用法分两层。当裁判是一层,当优化信号是另一层。有意思的是第二层,而大家吵得最凶的反而是第一层。

裁判那层问题很多,这篇自己也认了局限。你没法把一个 LLM 的打分当成最终判决,尤其是在专利这种每个字都牵扯法律后果的地方。

优化信号那层不太一样。你不需要 judge 绝对正确,你只需要它每一轮都能指出一个"这里可以更好"。哪怕它的尺子和人类律师有偏差,只要这偏差是稳定的,迭代就还是朝一个方向走。稳定地偏,也能当梯度用。

这个类比是我自己加的,论文没这么写。但我觉得它比论文的说法好懂。

还有一层意思:一个便宜模型加上一个好 judge,省下的不只是钱,是"我到底该选哪个模型"这个问题的权重。这个问题问的人太多了,答案可能没那么要紧。

对普通人意味着什么。

如果你在用 agent 干稍微长一点的活,现在力气大多花在"换个更强的模型"上。更划算的可能是先给自己搭一个小小的 judge 环节。哪怕就是让另一个会话读一遍产出,列三条问题回来,再改。听起来很土,但这篇说明它管用。

也别指望 judge 替你确认对不对。它能帮你把草稿推到一个更好的位置,不能替你签字。

专利撰写只是个测试场景。真正被这套东西改变的,未必是专利行业,而是"一个人用便宜工具能不能做出像样的专业产出"这件事的分母。

写到这里我回头看了眼开头,说了"这期只收一条",结果还是塞了不少。极简这件事,我自己也常做不到。

本周就这些。

上面有任何一条你试过、或者觉得我讲错了,欢迎告诉我。

下周见。

阿简
阿简

每周替你把 vibe-coding 圈的大事筛成一张小抄,被讲玄的概念一句话搞懂。

查看主页 →