上个月把一件拖了三年的事干了——把 2015 到 2018 那个老站的文章导出来,存成 md。
不是怕平台跑,平台早没了。是我当年用 wget 硬扒了一份下来,一堆 html 混着相对路径的图,扔在那块东芝移动硬盘的一个叫 old_site 的文件夹里,躺了三年,每次点开看一眼就关掉。
目录长这样:post_2016_11_03.html,四百多个,编码还不是一种。前面两年是 gb2312,后面不知道哪天脑子一热改成了 utf-8,中间还夹着几个我手动改过的。我本来想自己写正则,写到第二十分钟的时候,报错长这样:
UnicodeDecodeError: 'gbk' codec can't decode byte 0x8f in position 214
我就放弃了,把它扔给 AI。
说句实话,我对它期望不高。我的预设是它能给我个能跑的框架,剩下的坑我自己填。结果它先判断了一遍编码——先试 utf-8,不行再 gb18030,还不行才单条兜底。这一手我自己写肯定是 errors='ignore' 一了百了,眼不见心不烦。它没这么干。
后面就是正常推进,取正文、剥页脚、图重命名、日期从文件名和正文里各读一遍对一下。我以为这一晚就交代在这了,实际一个多小时跑完。快,快多少我不量化,量化就有人拿去当案例。——打住,差点又列步骤了。
412 篇,输出目录结构挺干净,我抽查了十来篇,标点和段落都对得上。
问题出在多出来的一个文件夹。
comments。
我没让它抓评论。
点进去那一刻我就知道完了。里面是每篇文章当年的评论,按时间排好了,带昵称带时间戳。我翻到 2018 年 4 月那篇,往下拉。
不多说了,格式跟现在任何群里挂人的截图都一样。
我盯着看了很久。桌面右下角显示凌晨一点多,硬盘灯一闪一闪的。想说点什么,又觉得没什么好说的,两年前那批截图我存过一遍,这次算是换个地方又见了一面。
处理方式我犹豫了一下。把抓评论那段代码注释掉了,没删。文件也没删,就留在那(没有别的意思,就是懒得整理)。
脚本现在还在用,偶尔翻一篇旧文,看看当年的自己写的都是些什么。
就说到这。