四秒白屏之后,我把那份 notebook 公告关了
我点开那份发布公告。白屏。等了四秒,第五秒我已经在干别的了。 JupyterGIS 0.16 的公告,一个用地图工具做的故事地图,notebook 端出来的。递归得挺漂亮,这点我承认——自己的东西发布自己,梗是对的。 关掉这页之后我在想另一件事。 为什么内容格式每换一次代,第一个被搬上去的,总是最不该搬的那类东西。
我点开那份发布公告。白屏。等了四秒,第五秒我已经在干别的了。 JupyterGIS 0.16 的公告,一个用地图工具做的故事地图,notebook 端出来的。递归得挺漂亮,这点我承认——自己的东西发布自己,梗是对的。 关掉这页之后我在想另一件事。 为什么内容格式每换一次代,第一个被搬上去的,总是最不该搬的那类东西。
最近到处都在转那个 LLM 水印测试。 简单说,就是给你三道文本,其中只有一道带了水印,让你猜是哪一道。十道题,全做完才能看答案。 结论先摆:绝大多数人猜不出来。评论区报分什么数都有,3/10、0/10、4/10、1/10、2/10,也有 7/10 和 8/10。有人算过,每题三选一,3/10 跟闭眼蒙没差别。

arXiv:2608.18214,astroph.IM 那边上个月挂出来的。哈勃的 CCD 在低地球轨道上被当作剂量计用了二十四年,攒出一条辐射损伤的时间序列。 曲线跟着太阳活动在变。不奇怪。奇怪的是相位——它跟太阳黑子、日冕物质抛射的节奏对不上,差好几年。 论文后半段才是我想说的。

凌晨一点四十,我在看一个 KeyError。 没有花里胡哨的堆栈,就是一个循环里对 dict 直接取值,上游这次少给了一个字段。 修起来三分钟,定位花了四十分钟——出事的地方和报错的地方隔了四层调用。修完我没睡,顺手跑了个 blame,想看看这行是哪个天才写的。 一点不意外:一个月前,我自己 approve 的。

先把丑话说前面:Tcl/Tk 在 2026 年依然值得用,但只限三个半场景——你手里有一堆 C/C++/Rust 核心代码需要快速包一层 GUI 或 CLI;你在 EDA、仿真、芯片验证这些本来就有 Tcl 沉淀的行业;你要做单文件分发的小工具或安全沙箱。那半个是已经在维护 Tcl 老系统、不想重写的。

前阵子刷 dev.to,看到 Adam 的《Portfolio Update, I Guess》,8 月 26 号发的。开头他自己就交代了:这篇不是本周主文章,不提供知识增量,就是聊聊作品集改版。
上个月 arXiv 上有篇论文,副标题里有个词挺扎眼,软件的去民主化。 它说的是:AI 让更多人能把代码写出来,但能让这些代码真正立得住的人,没变多,反而更集中了。 这跟我们平时听到的那套话,正好反着。 论文反驳的是那种预测,生成式 AI 很快会写完所有代码,编程这件事要结束了。作者没接这个。

9 月 4 号,凌晨一点二十二,客户群里甩来一句"导出又卡住了"。 我在被窝里,盯了两秒,回了句"我看下",然后爬起来开电脑。我们那个导出功能是个 Node 脚本,晚上定时跑,把某个客户的商品表导成 Excel 发群里。白天好好的,这客户的数据量最近涨了一大截。 远程连上去,日志停在"开始处理 sku"。再往下没了。
arXiv 上挂了篇 AutoDesign(2608.13560),做的是论文自动生成会议海报。我第一眼扫到标题里的 MetaHarness Optimization,心里"哦"了一声,差点划过去——又是 prompt 搜索换了个名字吧。

上个月接了个小活,隔壁部门老王介绍的,他表哥开的小厂子,做个报工系统,就是车间那几台机器,工人扫码报数,后台出个统计。 我一看需求,好家伙,简单啊。扫码、写库、出报表,这不就是当年跑批那套东西换个壳。要我说这活儿三天的事,报价我报了个八千,够意思了,熟人价。 结果这一报出去,坑就开始了。
前几天凌晨,我让 Claude Code 把沃尔什滕那个蒸汽机务段的时刻表页扒成结构化数据。Parowozownia Wolsztyn,波兰那边唯一还在日常跑蒸汽客运的地方——这个背景不重要,重要的是那个页面。 它十分钟交活。

这条在讲 OpenAI 从 8 月 25 号起给 ChatGPT Plus 用户重新套上 Codex 和 ChatGPT Work 的五小时使用上限。出处是 9to5Mac 的 Marcus Mendes,原文发布时间是太平洋时间 8 月 24 号下午。

最近有人问我,RAG 系统只要答对率上去了,是不是就算调好了。 不是。 8 月 25 号,arXiv 上挂了一篇预印本,编号 2608.24753,主分类 cs.CL,标题叫 The RAT,做的是一套 RAG 评估的贝叶斯框架。

先把这个结论撂这:iLands 群发的那批 25 美元一封的 AI 代理邮件,表面是推销,本质是把获客成本从创始人账本上划掉,转嫁给收件人和 Amazon SES 的滥用容忍度。这算盘打得比它的 agent 写得还要聪明。

八月底 Ken W Alger 往 AI Memory Stack 系列里插了一篇 Part 4.5。编号本身就是信息:不是新开一章,是补丁,补的是 Part 4 底下二十条评论吵出来的那点共识——一条推理账本记录到底该装什么。

八月十九号,dev.to 上那篇讲 AI 内容历程的长文,署名 Ryan Carniato,挂在 Playful Programming 底下。第一遍我读得很快。第二遍在 2019 年那一段停住了。 那段讲他早年给 Angular in Depth 投稿。

多智能体防幻觉这事儿被讲得越来越玄。玄到好像 agent 一多、让它们互相吵两句,幻觉就自己没了。 上个月翻到一篇金融问答的论文,CLAIRFin,arXiv 2608.13706,我点开的时候已经更到第三版了。九个智能体。第一反应:哦,又是个堆 agent 的。 从头看到尾,那九个根本不是重点。
这期记一个GitHub仓库和它周围的一次讨论。结论先放一句:一个声称“不再信任回执”的补丁,回头又踩进了它自己想堵住的坑,而作者自己承认修复还没发生——卡点不在逻辑,在席位。公开记录为主,确认的事实、别人说的话、我自己的分析分开标。 先把时间戳摆开。

"AI 形成了自己的审美分类"——这类说法你八成刷到过。多数时候它的源头是一篇论文,而论文里真正发生的事,跟这句话给人的印象差着好几层。

前几期塞得满,这周只收一条。 不是没动静。是动静都太吵,挑不出一句能对普通人讲清楚的白话。吵的那些下周再说。 留下来的这条,8 月 25 号挂在 arXiv 上,cs.CL,交叉到 cs.IR,作者两个人。标题里有个 Less can be More。这种标题一般两种下场,要么标题党,要么真把常识说反了。 这条是后者。