跳到主要内容
能丢给 agent 的活,长什么样

能丢给 agent 的活,长什么样

阿简
阿简

· 阅读约 5 分钟

什么叫"能丢给 agent 的活"?

上周 Breen 在 Res Obscura 上发了一篇,讲 AI 实验室该不该出钱资助历史研究。他拿 GPT-6 和 Opus 5.5 追炼金术的线索、读 17 世纪的信。主张先放一边,那篇里最该抄的,是他顺手列的一份条件清单。

清单说的是模型最擅长处理哪类问题。

一次列了五条

白话版:领域专家已经知道要问什么。材料已经数字化、拿得到。问题需要多语言推理,或者高等数学,或者大范围检索。能用定制代码解决。答案能被证实或者证伪。

五条里最狠的是最后一条。答案能被证实或证伪。

这一条一卡,"让 AI 帮我写一段历史解释"这类活就全出局了。解释没有唯一答案,Breen 自己在后面也承认了。

第一条也容易被忽略。得是专家已经想清楚的问题。不是让模型去找问题,是拿已经磨好的问题去问它。

能塞进这个模子的历史问题,只有三类

密码学和破译。跨翻译和改编追踪文本。把分散在小众子领域里的发现连起来。

就这么点。三类都不是历史学的主干,是边缘的、技术性的、有确定答案的那种。

所以这份清单不是"AI 什么都能干了",是"能干的活被划出来一个小圈"。Breen 敢把圈画这么小,我反而觉得可信。

Hartlib 档案里翻出来的那个字谜

Opus 5.5 从 Samuel Hartlib 的档案里下了五千多份原始文件,建了一堆子代理,跨语言在 Google Books 这类地方交叉核对那些匿名和未识别的来源。

然后它注意到了东西。Newton 和 Hartlib 都用字谜藏"匈牙利矾"这个炼金术原料,但藏法不一样。Newton 的 Vltimorui 是 vitriolum 字母重排出来的正经字谜,Hartlib 那边是反向书写,还写得不完全准。Miloirtiua 反过来接近 uitriolum,riciragnun 反过来接近 ungaricum。

关键是,17 世纪的读者在页边写过 vitriolum angaricum。

这就是清单里"答案能被证实"的活样本。页边那条注释是独立证据,不是模型自己说的。Breen 说这可能是新发现,可能值得发表。

我信这个案例,恰恰因为它能被验证。

两封西班牙语信件,其实早就被破译过

Opus 5.5 在作者写文章那会儿,部分破译了两封用 Charles V 秘密代码写的 16 世纪西班牙语信件。听着挺唬人。

问题是这两封早就被破了。一封在 1530 年代写的时候,后面就跟着明文密码页。另一封 1916 年被破译过,Google Books 上一查就有。

Breen 说这个案例说明的是专业知识和案头研究的重要性。

我觉得还说明另一件事。AI 做出来了,不等于这事以前没人做出来。这两种说法特别容易被混成一种。搜一遍就能查到的旧答案,被写成"AI 破译",味道完全不一样。

Enigma 那封,日志到现在没分析完

Astra 破了一封 1941 年 7 月 10 日的 Enigma 消息。Breen 说关键不在于破译本身,在于它注意到了可获得的全部信息的范围。

这句我没完全吃透。大概是说模型赢在把所有能翻的都翻了一遍,不是赢在什么灵光一闪。先放在这里,等我搞明白再补。

有个细节比结论有意思。历史密码学研究者 Frode Weierud 说,团队到现在还在分析 Astra 的日志,想弄清它到底怎么破的。而且 Astra 引用的档案文件是对的,却不在 Crypto Cellar Research 网站上。它到底真进了德国联邦档案馆的数字化馆藏,还是从别处翻到的,没人说得清。

看完这段,我的感觉不像在看一个解法,像在看一份没人能复现的实验记录。

Darwin 那个项目是模型自己提的

作者本来让两个模型去找一战二战的加密材料,没找到,他的判断是低垂果实已经摘完了。

然后 GPT-6 自己提出来,去查 Darwin 的著作,检索 Darwin 为自然选择收集信息时引用过的来源,找他和信息提供者之间还没被发现的联系。

Breen 说这符合他对有价值研究项目的专业直觉。项目还在跑,没有决定性结果。

模型能自己提出一个专家觉得像样的题目,这件事我还在消化。先放这里。

John Dee 那本书,Astra 说基本不是密码

Dee 和 Kelley 那部天使语言手稿 Liber Loagaeth,Astra 的结论是它基本不是密码,大多是无意义音节。

它还拿字符重复频率的数学分析跟 Dee 的日记交叉比对,推断 Kelley 在某个日期之后越来越偷懒,重复自己越来越多。另外有一段表面无意义的文字,实际指向 Dee 虚构天使体系里的 Bornogo。

Breen 说这不是 Dee 研究里的重大突破。我同意。

但一份清单要能用,就得容得下这种不炫的结论。一期只报"重大突破"的清单,通常是在挑好消息给你看。

最后

Breen 提了三个干预。数字化未公开手稿并免费开放。给历史学家免费 API 或者算力。让历史学家像数学家一样,坐下来一起定重大开放问题。

前两个是钱的事,第三个是习惯的事。第三个最难,也最值钱。

那份清单不只对历史学有用。你下次想把一件事丢给 agent 之前,先过一遍那五条。问题清楚吗。材料拿得到吗。答案能被验证吗。

三条过不了,就别浪费那个额度。

本周就这些。

上面有任何一条你试过、或者觉得我讲错了,欢迎告诉我。讲错的我补,没讲清的我改。

下周见。

阿简
阿简

每周替你把 vibe-coding 圈的大事筛成一张小抄,被讲玄的概念一句话搞懂。

查看主页 →