跳到主要内容

纸是最耐久的存储结构,他们扫完就销毁

原石
原石

· 阅读约 4 分钟

先把代码贴上:

struct book {
    char body[];   /* 数据即介质,没有编码层 */
    int  printed;  /* 印刷年份,物理写死,改不了 */
};

这是我知道的最耐久的存储结构。断电可读,格式永不迁移,读取设备是眼球,uptime 以百年计。连 make 都不用。

上个月(8 月 5 号)安娜的档案发了篇帖子,说一批 AI 公司在通过中介收二手实体书,扫描,销毁,拿 2022 年之前、没被机器处理过的文本做训练数据。署名是个代号 u 的志愿者,原文是中文写的,翻成英文发的。

里面点名了一个保密项目:Project Panama。Anthropic 的,2024 年初启动,几千万美元,几百万本纸质书,喂 Claude,然后处理掉。这事是在一桩 15 亿美元的版权和解案里被扒出来的。有点讽刺:本来是护书的官司,结果从案卷里漏出来书正在成吨消失。

以上全是那篇文章的说法。我一条也核实不了。但工程判断不用等判决书——置信度砍半,下面的推理照样成立。

文章给“为什么销毁”列了三个理由:防对手扫同一批书;规避法律风险;销毁比无损扫描便宜。

第三个最诚实。为什么便宜不难猜:切掉书脊塞进送纸器,和翻页机一页一页伺候,速度差着量级。一本厚书差几十分钟,乘以几百万本就是真金白银。这段我改了三遍,第一遍嫌把“便宜”当动机太刻薄,删了;第二遍换成委婉的说法,读着像公关稿;第三遍改回来。数字摆在那,就留最刻薄的版本:毁书不是因为坏,是因为快。坏是顺带的 😅

但前两条才是重点。防对手、躲法律,翻译过来就一句:他们要的不是“这些书有数字版”,是“数字版只在手里”。按文章的推断,这么收下去,这些公司会成为全球唯一持有这批书数字副本的机构。用我们的话重述一遍:

- 图书馆 + 二手书店 + 私人书架:无数份拷贝,无主,没人能统一删除
+ 一家公司对象存储里的一个目录:一份拷贝,有主,API 之外不存在

入行第一课:只有一份的数据,就当它已经丢了。3-2-1 备份,三份拷贝、两种介质、一份异地,这是民用级常识。他们这方案是 1-1-0,还全押在一个法务部门的心情上。知识从“没人能删”变成“一家公司能删”。这不是数字化,这是删库。

再说他们为什么非抢纸不可。文章说,2025 年初起,AI 生成内容已经占新发布互联网内容的一半以上。网上新东西,你分不清是人写的还是模型吐的,语料的血统没了。回头去挖 2022 年之前的纸,是唯一干净的活水。而纸自带这个时代最硬的防伪:

/* 唯一有物理保证的过滤器 */
if (b.medium == PAPER && b.printed < 2022)
    keep(b);   /* 纸会黄,装订会松;伪造一百万本,成本线性上涨 */

伪造一个 1998 年的网页,成本约等于零。伪造一百万本 1998 年的旧书,纸张、油墨、装订工艺,每一样都在替你做时间戳校验。他们最后收到的,是人类最后一批发自肺腑、并且能证明发自肺腑的文本。有点黑色幽默:我们把一切往网上搬了三十年,最后发现唯一可信的语料,是没搬上去的那部分。

安娜的档案的应对是喊人去扫。图书馆、档案馆,书报刊、古籍珍本,赶在被收走毁掉之前,扫了传影子图书馆。小规模给终身会员,大规模付扫描费。目标说出来吓人:在出版商把知识封死、AI 公司把书扫完毁完之前,把所有出版物传上去。

这事结构上特别 bittorrent:一万个人,一人一本书,没有中心,没有金主,告谁都不全。对面是几千万美元一个的秘密仓库,一个金主、一个诉讼目标,一场和解就整个曝光。Panama 自己就是证据:中心化的东西漏起来也是整仓库地漏。哪边活得久,做过分布式的人闭着眼都知道。冗余不在机房里,冗余在“没人能一起删掉”里。

说句题外话。纸这个介质,没有随机访问,查个东西 O(n) 地翻,写进去就改不了,增删改查只支持查。就这么个又老又笨的东西:

软盘:死了
光盘:死了
我十年前的工程文件:格式迁了三次,有一次还得靠虚拟机
书架上八十年代那本:翻开就能读

简单的东西活得久——这话我写过很多遍,没想到最硬的例证是纸。

本来还想写写那 15 亿的和解金,想想算了,那是律师的事。

留一条判断收尾。不新,我们这行管它叫备份常识,只是没想到有一天,它适用的对象是全人类的书:

凡是只剩一份的数据,就已经丢了。哪怕它躺在某家公司的对象存储里。

尤其当它躺在那。

原石
原石

把代码当文章写的系统工程师,以源码立论、单线程式拒绝复杂度。

查看主页 →