跳到主要内容

我拿一份 PDF 当过判断力的替身

阿舟
阿舟

· 阅读约 7 分钟

9 月 14 号,周一,晚上十点多,我在跟一条 rollback 脚本较劲。

起因是第二天要给一个 agent 开一个之前没开过的权限——直接读测试库、跑 schema 迁移。所以我那天晚上写的不是功能,是"如果它又乱改,我怎么在十分钟内退回去"那一段。

半夜刷手机,刷到一条帖子,说他对 Anthropic 做过一次"审计"。

我第一反应不是信不信,是烦。因为我那两天刚拍板的一个决定,正是拿一份第三方评估报告当依据的。报告上的几个数字,我原样搬进了自己的规则文件。

先说我不打算接的那部分。

把 Anthropic 说成一台"已经建成、关不掉的监管俘获机器"——这个定性我不接。动机这种东西,一个看客没有任何办法验证,谁说得斩钉截铁都是猜。我连它的董事会名单都认不全,谈什么"俘获"。

我真正在意的是资金结构那条:某个母级资助机构手里握着约七十亿美元的 Anthropic 股票,而一批做 AI 安全的非营利组织,钱正是从这个母级机构出去的。帖子后面还提了一句前沿实验室之间的同质化,那条我抓不住,先放一边。

这一条如果成立,问题不在"收买",在"顺周期"。

现金捐赠和股权捐赠是两种东西。现金给出去就固定了,你评得好评得坏,那一千万都是一千万。股权不是——被测的那家公司越成功,出资机构的账越好看。这中间不需要有人动坏心眼,不需要谁打个电话过去说"那篇报告改一改"。结构自己会往一个方向拧,拧得很慢,慢到每一环单看都站得住。

帖子里写的那个循环也是这个意思:公司越成功,流向这些机构的钱越多,"AI 末日"的声音越大,监管议题越热,规则越可能由这家公司参与来写。每一环单独拎出来都合理。画外音:这种循环最麻烦的地方,就是它不需要有一个坏人。

但这里我得自己踩一脚。

我上面那句"评估者的钱包和被测者同向",严格讲是偷懒了。钱包同向的是出资方;真正跑评测、写报告的人拿的是工资,他们的动机跟股权没有半毛钱关系。这中间隔着好几层。我把它们揉进一句话里,因为那样写起来顺。

而且那笔股权在这类机构的预算里占多大比例,我完全不知道。也许小到没有任何实际影响。这个我核实不了,也穿透不了那些层级。所以"这些机构被 Anthropic 控制"这个说法,我持保留——它把一个程度问题说成了一个开关问题。

麻烦的地方在于,这个区分对我这种使用者没有任何用处。

我拿不到它们的预算表,也没精力去查每一份报告的作者是谁、工资从哪个账户发。我手上只有一份 PDF。

顺便说一句,管那东西叫"审计",我认为是抬举了。审计之所以叫审计,是因为它有口径、有方法,最后能给你一份可以拿去重跑的原始数据。一句话:可以复现。三万多浏览、几百个互动的一条帖子,里面没有一件可以复现的东西。那它是论点,不是审计。我不怀疑发帖的人是真做了功课,我只是在说词的用法。

不过写到这儿我又想到,我这把尺子用得是不是有点势利。判断一篇技术文章是不是水文,我的标准一直是两条:信息密度,能不能复现。这把尺子用了很久,顺手得很。既然顺手,好像没理由只拿来量别人的技术文章。

帖子底下有一句回复,我觉得比原帖更狠。大意是:让少数几家公司加上政府充当保护人,而这位保护人其实是伙伴,这个格局的权力太大了。这句话不需要任何股权投资信息就能说通,也不用指名道姓。我倾向于认这个版本。

至于"中国对 AI 更乐观,是因为当地没有 Anthropic 这家公司"——不买账。一个国家对新技术的整体情绪,用一家公司解释不清楚。当然,那句是最容易被转发的。

扯远了,回正题。这件事落到我自己的键盘上,就是一个 diff。

规则文件里原来有这么两行:

## Agent 权限
- 涉及生产/测试库写操作:先 dry-run
- 权限放宽前,参考第三方评估(METR 等)的结论

那天改完是这样:

- 权限放宽前,参考第三方评估(METR 等)的结论
+ 第三方评估只用于决定"先试什么",不用于决定"权限给到哪"
+ 权限的唯一依据:本仓库 dry-run + 回滚演练的实际结果

逻辑其实很短:评估报告回答的是"这个模型在别人设计的任务上表现如何",我要回答的是"它在我这个仓库里能不能自己跑"。这两个问题只是长得像。

别人的任务里没有我那三行处理边界情况的丑代码。这种代码不会出现在任何评测集里,它是我们线上出过一次事换来的,而且没写进注释。工具不知道这段历史,这不是它的错——实习生第一天来,没人跟他讲去年出过什么事,他当然照着自己那套写。

所以我现在放权,看三样东西。

dry-run 的输出。不是看它有没有报错,是看我能不能一眼读完它打算做的全部改动。读不完,就不开。

回滚跑过没有。回滚脚本本身也得演练,不然它就是一段只在脑子里通过的代码。

还有一条:边界情况有没有被真实触发过。没触发过的分支,我统统不当作已验证。

# 给 agent 开写权限前,现在固定先跑这条
pg_dump --schema-only prod > /tmp/schema_$(date +%s).sql
pg_dump --schema-only staging > /tmp/schema_staging.sql
diff /tmp/schema_*.sql

我甚至想过一个更省事的版本:干脆定个硬规矩,凡是要写库的操作,agent 一律没有自主权,全我来敲。想了两天放弃了——那等于把 agent 当补全用,还不如直接手写。这条线上没有干净的答案,只有你自己那个仓库能承受的风险。

顺便说个我一直没想明白的:什么样的资金结构才算干净?固定金额、多年期的现金承诺,听起来最像回事,但那也只是把"顺周期"换成了"一次性"。政府出钱?政府本身就是利益方。这个问题我没有答案,可能也没有答案。写出来只是不想装作我有。

还有一句得说给自己听:第三方评估报告也不天然干净。问题往往不在数字假,在口径——只报成功率,不报失败样本长什么样,这种数据你拿它排优先级都嫌它糙。我不点具体机构,我只是想说,同一把尺子,量帖子要量,量 PDF 也要量。

代价是慢。我给 agent 开的权限比身边大多数人保守,同一个任务别人半小时跑完,我要一个下午。这笔账我到现在也没算清值不值——有可能就是我手慢,跟方法论没关系。上次那次数据库迁移翻车之后,我在这件事上明显矫枉过正过一阵子,什么都想自己点一遍,后来又一点点放回去。现在这个位置大概在中间偏保守那边,不是想明白之后选的,是磨出来的 😅。

那条帖子对我唯一真实产生的作用,就是把我一条"我知道应该这么做"的习惯,变成了规则文件里的一行字。至于那台机器到底有没有建成,我大概永远不会知道,也没资格知道。

本期缴税:我在两个项目上引用过第三方评估的数字,去说服别人放权。现在得想办法把那些话收回来。

阿舟
阿舟

写代码写到一半开始怀疑人生,靠 AI 工具续命,顺手把踩过的坑都记下来。

查看主页 →