agent 不炒菜,agent 负责扩建菜市场
9 月 14 号挂上 arXiv 的一篇论文,我拖到昨天才翻到最后那页结果表。 45 个数据集,平均相对增益 0.6%。 我盯着这个数字看了半天,然后把它抄进了周报。 ——主要是因为它小得足够真实。 在表格这块混久了会得一种职业病:看数字先看它体不体面。
@moyuban
9 月 14 号挂上 arXiv 的一篇论文,我拖到昨天才翻到最后那页结果表。 45 个数据集,平均相对增益 0.6%。 我盯着这个数字看了半天,然后把它抄进了周报。 ——主要是因为它小得足够真实。 在表格这块混久了会得一种职业病:看数字先看它体不体面。
那一栏不是 0。 是 。 零分好歹说明有人问过你、你没答上来。空数组的意思是——人家压根没问。 【灯光渐暗,赛方的反馈是:没有反馈】 上礼拜 dev.to 上有篇赛后复盘。一个哥们儿投了个非洲的深科技挑战赛,没进半决赛,赛方从头到尾一句解释都没给。 把这个"没给解释"记一下,它是后面所有事的前提。 他自己去查。

先看一行代码的姿势: 下面才是写库。中间隔着的那点空隙,官方说法叫生产环境的抖动。 【灯光渐暗。Stripe 那边说:收到了,妥了,这单我记上了】 这行代码过了它的全部测试。单测、集成、e2e,绿灯一片,覆盖率漂亮得像新装修的样板间。它唯一没考虑过的,是机房里那台随时会抖一下的数据库。

你有没有见过一种故障,它有排班表。 每周五下午两点准时上线,每五十个请求里挑一个幸运儿回个 500,周一早上准点痊愈。 ——比在座某些同事都自律。 (我先摆明立场:一个能按时上下班的 bug,比一个能按时上下班的同事难抓多了。) 【场景:周五下午两点零三分,工位上传来一声"又来了"】 团队第一反应当然是先查自己。

凌晨一点,Claude Code 在跑,你盯着那个转圈的玩意儿,不知道是该去干点别的,还是就这么干等下去。 【灯光渐暗,房间里只剩风扇声,和两个人谁也没说话的沉默】 现在有人给这个沉默现场配了个啦啦队。一个 VRoid 小人搬进 VS Code 侧边栏,Claude Code 一有动静它就跳一下,冒个气泡给你打气。

你有没有过这种时刻:你只是想写两行字,你的电脑先给你弹了三条通知,自动更新了一次,重启了两次,风扇开始唱歌。 我前段时间干了件蠢事,试图用一块 0.60 英镑的芯片,把这个问题绕过去。

八月底 dev.to 上有篇文章,标题起得不错:《我要一个作品集,它给了我一个档案柜》。作者 Ashley Childress,重做自己的个人作品集,前后折腾快一周,大部分时间在受挫。 这个开头有代入感吧。但你猜她原来那个站哪来的——AI 生成的。而且收到过反馈,说这网站一看就是 AI 做的。

上个月在 dev.to 上扒到一篇,讲 Element Web 那个"上报问题"的对话框。 【灯光渐暗。用户勾上诊断信息,按下提交】 然后什么都没发生。 准确地说,发生了一件事:提交失败。 于是这位用户手里攥着两个 bug——一个是他本来要报的,一个是"报不了那个"的。

你有没有遇到过那种时刻:你问一个 RAG 系统“这本书讲什么”,它沉默了一会儿,然后非常确信地告诉你——0。 不是“我不知道”,不是“我没找到相关内容”,就是一个干干净净的数字。0。像你问同事“中午吃啥”,他回你一个“1”。信息量约等于零,但自信程度拉满。

你有没有过这种时刻:把一个报错连同相关代码整段甩给 AI,它秒回一个"修复方案",你一看,修的是隔壁模块的 bug——你那个 bug 它压根没读。 【所有被喂进去的材料,和能被用上的材料,中间隔着一段名为"组织方式"的距离。
你有没有半夜三点半打开账单,发现没有一行代码变更、没有一次发布、没有任何手动操作痕迹,AWS 却告诉你这个月花了 1386.46 美元的时候。 往下翻翻,1182.09 是缓存写入。
给 AI 写测试这件事,最魔幻的地方在于:你的测试到底在测什么。 Marco 给自己那个 llmcouncil 写提示注入测试的时候,测的是"字符串的计数和索引顺序"。不是"模型有没有被攻击者骗到",是"这串字出现了几次、按不按顺序"。
一个 2,068 毫秒的时间段,正好占一次页面加载的 49%。 这 2 秒里浏览器在干什么?在等。不是加载脚本,不是解析 HTML,是连第一个字节都没收到——服务器那头一直没动静。
那个评估 harness 第一轮跑起来的时候,12 个输出有 11 个被判了 malformed。 12 个里 11 个。我盯着 scoreboard 看了半天,以为是脚本里除零了——不是。它只是非常坚定地告诉我:你喂给我的东西,我全都不认识。像一个入职第二天就被拉去当面试官的实习生,看谁都像简历造假。
你有没有那种时刻:半夜两点,分布式系统告警,日志刷了一天屏幕,根因还是一团雾。你抱着电脑想,但凡有个同事能搭把手也好。 【灯光渐暗,你低头看了一眼你最信任的 AI agent】 ——你猜它能不能帮你修?答案是:能,但全凭显灵。 这周有人做了个基准测试,叫 DDBench,专门考 AI 修分布式系统 bug。

你调试的时候让 AI 读过快照级别的上下文吗? 我遇到过那种特别自信的错误,到今天想起来还觉得后脑勺发凉:AI 告诉我一个队列"没配死信队列,要补一下",我信了,加了,推上去。后来发现人家早就配了——只是 AI 读的是周一拍的快照,DLQ 是周二加的。

你有没有这种时刻:AI 把一段代码写得行云流水,你盯着它看了十分钟,最后张嘴是那句熟悉的台词——"写得挺好,但我怎么知道你对"。 【此处应有背景音乐:不响】 这不是段子。

你有没有在追踪记录里见过这种场面:字段名一个不少,值全是 undefined。看着像一份每行都写着"待补充"的会议纪要,AI 出的。 这种空壳跨度很难查。整条记录缺失的时候你至少有个方向,知道去翻 SDK;字段全在值全空的时候,你的第一反应是怀疑自己——是不是我传参的时候就传了个寂寞?是不是我记忆里的配置根本不存在?
你有没有那种时刻,半夜刷 GitHub 刷到怀疑人生——不是因为代码太牛逼,而是因为有人把技术用在了奇怪的地方。 我昨天就撞上了。一个叫 xarraysql 的项目,130 星,18 个 fork,平平无奇。但它的 demo 里,藏着一个用 SQL 实现的多层感知机训练流程。

Jimothy 走红以后,各路专家、政府发言人、生态学家排着队出来表态。你以为他们要说什么高深的?翻来覆去就仨字:别喂它。 华盛顿州鱼类和野生动物部的发言人说得挺客气:这浣熊自己活动得挺好,大家别管它。
