54 次调用跑完,我记下来的不是排名,是三种不报错的失败
前几天翻到一份公开的推理端点对比测试:六个模型、三种提示形态、每个模型跑三次,一共 54 次调用。每次记了首 token 时间、总耗时和单次成本,总花费 0.0185 美元。发出去的地方是从欧洲的笔记本上,晚上十点左右,带着跨大西洋的网络条件。 点进去本来是想看谁快的。

前几天翻到一份公开的推理端点对比测试:六个模型、三种提示形态、每个模型跑三次,一共 54 次调用。每次记了首 token 时间、总耗时和单次成本,总花费 0.0185 美元。发出去的地方是从欧洲的笔记本上,晚上十点左右,带着跨大西洋的网络条件。 点进去本来是想看谁快的。

昨晚十点多,一个小功能跑通了。 我盯着终端看了大概十秒。没高兴。 心里冒出来一句「它是真的成了,还是只是看起来成了」。这几个月我大概是第一次,在一个东西跑起来的时候,第一反应是怀疑。以前跑通就是跑通,现在这三个字在我这儿会卡一下。不知道为什么卡,就是卡。 然后说那篇论文吧。

我上周刚被一个 agent 项目的测试报告骗过。绿得发亮,覆盖率写在 README 里当门面。结果真的上手一跑,多一步工具调用就崩,多一句对抗输入就照着做了。

dev.to 上前阵子有篇 Dimitris Kyrkos 写的文章,标题挺冲:AI 生成的测试没在测你的代码,它在测模型的盲区。底下四十多条评论,一帮人拿自己的经历在对账。我一路刷下来,越看越觉得它戳中的东西根本不在"测试是不是 AI 写的"这一层。
上周翻到一篇预印本,9 月 16 号挂上 arXiv 的,标题大意是"AI agent 到底替谁干活",作者 Davood Wadi 和 Yu Ma,分类挂在一般经济学和 AI 底下——本来这种我不点开,跟值班这行不搭界。 让我停下来的是它的实验做法。

上周三晚上一道结算逻辑的题,我卡了四十分钟。中文题面扔进去,样例全过,第三个测试用例直接崩。翻成英文,逻辑一个字没改——一把过。 画外音:当时我第一反应是"行吧,又是玄学"。
先说结论:三天前挂上 arXiv 的 ProgramDistill,最值钱的不是榜首成功率,是「恢复深度从 1 加到 8」那一列。前一列谁都会剪进 PPT,后一列得你自己坐下来算。 论文讲的事不复杂。现在的编码智能体评测基本是喂一条 issue、一句指令,告诉你"要什么行为",然后看它写不写得出来。

刷 arXiv 的 cs.CL 列表刷到的,arXiv:2609.18605,标题长到一眼看不完,Mika Okamoto 和 Ansel Kaplan Erol 两个人的活。

这条讲的是怎么给 agent 循环加一个独立验证器,把“我写完了”和“写对了”拆成两件事。出处是 Oyedele Temitope 给 Hackmamba 写的教程,上周发的。 我一开始扫了眼标题,以为又是那种“给 agent 加个验证步骤”的正确废话,读到作者直接规定验证器只能回四种结果、不回别的,才确认值得点。

TheFlow0 退圈了。 安迪·阮。PS5 这条线上待了十几年的人。前阵子他在社交媒体上说,自己退出 PS5 破解,PS5 Linux 那边的工作也停了——本来打算把 PS5 Pro 的支持做完,2027 年发。几个月的活,就这么扔了。 圈里的反应基本是"大佬被白嫖狗气走了"。情绪我懂。
Any Human Ever 这个站,全部逻辑就是三次随机。 年份先出,地点拿年份当条件,人生拿前两个当条件。整个站的状态就是这一个 struct,四个字段,里面一个指针。输入是"有史以来活过的所有人",一千亿往上,它一个都不存。 抽签顺序不是随便定的。我见过反着写的:先抽一段人生模板,再往上贴个年份。跑得通。

速评:9 月 16 号挂上 arXiv 的 ReFigBench,从论文里扒了 1000 张总览图,测的是能不能把它们重建成可编辑的 PPT。 任务本身没什么可看的。

先说结论:方法方向我认,摘要话术打七折,绝对值缺位这一条先扣着不放。 9 月 16 号下午挂上去的,cs.LG 兼 cs.AI。PDF 九兆出头,TeX 源码都放了。到今天两天。MoE 剪枝这摊子,光把校准集在 122B 上跑通就得占掉好几天——所以这篇我还没跑。

烟雾报警器没有坏,因为确实有烟。 Chris Healey 在 dev.to 上复盘 PulseWatch 那次报警虚惊,最后查到报警是对的:一个 GitHub Actions 工作流,每 15 分钟跑一次,真的消失了一个多小时然后恢复。MISSING 触发,自动转 RECOVERED。设备没坏。这句话几乎可以当结论。

刷 dev.to 连着刷到两点多,一条标题里带"删了 18 万行"的把我钉住了。点进去,作者 Yash Kumar Saini,快两周前发的周报。 这期破一次自己的例,不给 owner/repo 报幕。主角不是某个仓库,是一个人一周的 commit 记录:十几个仓库,102 次提交,净删约 18.8 万行。
一点半过了,桌上那杯茶是今晚第三回续的水,淡得跟开水没什么分别,我懒得起身去换,就那么一口一口喝着。屏幕上那个 agent 还在跑,替我收拾一段白天写了一半就撒手的代码,进度条走得比我本人有耐心;这是今晚第二次夜航。

先把"主权 AI"这四个字翻译成代码。 四个字段,一个 struct。看着挺像回事。 串起来想一遍就知道它不是四个 feature。数据不出边界,靠的是你知道它在哪块盘上。权重能改,前提是它作为一份文件落在你手里,而不是一个别人家的 API。卡归自己,等于调度器不归别人调度。
我读到那里的时候停下来了。不是34,000行C++引擎,也不是21分钟出可玩角色。是最后那段——作者说他对那108个残留差异字节的解释"最不确定",而且"从来没亲自验证过"。 我盯着这句看了很久。一个以字节级精确为主线的复活故事,结尾竟然是块没被验证的空白。

这条在讲一个叫 Flag Game 的玩具模型,用来研究一群受限智能体怎么形成集体信念。出处是 Elizabeth Pavlova 和 Hidenori Tanaka,两天前刚挂上 arXiv,编号 2609.19124。21 页,10 张图,主题分类从人工智能到统计力学都占全了。
这个月初刷到一篇帖子,一开始我准备划走。 写帖子的人在做一套给 AI 编码助手用的记忆层,拿 Claude Code 自带的记忆跟他那套方案做了一组对比。这种帖子的套路我太熟了,对比是壳,广告是核。结果看到中间一段,我停住了。