先说结论:Nazar Boyko 九月八号发在 dev.to 那篇讲「AI 让开发者变懒」的文章,正文我给八分。不是因为结论新,是因为他在结尾扔了一道能在周一早上自测的题。
评论区 39 条,扣到三分。大半在自我表扬,没人应试。
那道题长这样:假设模型最近给你写的那个文件明天消失了,你能不能做出一个等效的,并且说得出它为什么能跑。
能,你的懒是良性的。不能,你上周合进去的那些 PR 快不快,跟这件事没关系。
狠就狠在它不是态度题,是操作题。不用比谁的 agent 多,不用比谁订阅贵,一杯咖啡时间自己测。
作者把懒拆成两种,一种是理解完之后把重复打字交出去,另一种是把理解本身也交出去。这个区分站得住。真正让我把文章看完的是那句——同一段 diff 里,评审和 CI 都分辨不出这两者。
这是全文唯一一句承认「从代码本身看不出来」的话,也是它比那些「AI 提效 N 倍」的稿子值钱的地方。
但我不接「懒惰是劳动再分配」这个标题级的漂亮话。「懒得打字」和「懒得理解」塞进同一个「懒」字里,听着聪明,实际上是拿一个顺畅的说法盖住两种完全不同的东西。作者自己拆开了,这步做对了。问题是标题太好念,点头的人多,真去测的人少。
先照一照评论区。
Ben Halpern 说自己不觉得懒,但原始编码能力确实在退,同时拿到了管 agent 这类新技能,系统性理解更宽了。这条听着挺圆,就是没答那道题。「更宽」是同一层加宽,还是换了一层地基——两回事。地基换了,上面那栋楼还得重盖。
InferHaven 那条是全场最好的之一,短,但扎在要害上:说「开始退化」没有量化指标,agent 的吞吐量能精确测,真正在变的那东西没人测。
这句我认。
还有人说自己一直懒得重复劳动,现在把想法变成能跑的代码更容易了,所以更不懒——换题了。有人说写得更少产出更多。有人说 AI 让他比以前更忙。有人拿作者文末那句「英语不是母语、用 AI 润色语法」开玩笑,说 AI 让人不光懒得写代码,也懒得学外语。这条我笑了,笑完发现它把话题带得更远了。
忙和懒都不是答案。
有位署名 xulingfeng 的 QA 说,AI 的输出他要亲自验过才信——这算半个答案。「验过才信」离「能重建」还差一截,但比「我更忙了」强。
然后 UnitBuilds。他是 39 条里唯一一个正面撞上那道题的人,值得单拎出来。16 个 agent、4 个系统、8 个项目并行,说没 AI 手工写要一年。这个吞吐量我不质疑,数字摆着。
但同一条回复里他自己写了一句:一百次生成会得到不同变体,只有 1 个是最优的。😅
这句话就是自爆!
作者追问得也准:一百个仓库里只有一个最优,你怎么知道手上这个是哪个;八个项目里有一个凌晨两点炸了,你能不能讲清为什么。UnitBuilds 的回答是:Rust 里能算理论最大值、内存是否零分配、基准能不能逐步细分,其他靠可测试性和覆盖率。
我给这个回答的判分是:一半真答,一半绕。
零分配、覆盖率这些是能测的客观指标,这部分不虚,说明他手里确实有不是靠感觉的判断依据。但指标能告诉你「这个版本没退化」,不能告诉你「凌晨两点的那个故障为什么来」。他自己那句「无法保证 AI 能完全相同地重建代码库」,其实已经把答案交了,是后面那串指标又把话岔开。
指标是验尸报告,不是病史。
有一说一,这轮里最好的一刀不是正文给的,是评论区 Michael Krupnyak 补的。他拿重试循环举例:语法你不记得没关系,但你得知道哪些失败值得重试、这个操作重试一次安不安全、重试次数耗完之后会发生什么。
这比我原本认的那道题好用。我一开始觉得「能不能重建」够狠了,现在收回半句——重建太粗。同一个人写三遍,也能重建出个八九不离十的版本,蒙对了自己都不知道。重试那三个问题不一样,答案是收敛的,答不上来就是答不上来,没有糊弄的空间,也没有「我这次运气好」的余地。
预期拉满结果被打脸,这次是往好的方向打。
回头说作者自己。他把答案停在「看每周情况,有时不确定」——这就是「不能」的委婉写法,他自己清楚。所以才有那句:这种滑坡不会自己宣告,只会让按 Tab 越来越容易。
这句我留着。我这边也有一半没测完的,先别信我这半句。
锐评评分卡:文章值不值一读?值。但重点不在正文,在被点赞排序压下去的那两条评论——InferHaven 说「正在变的那东西没被测过」的那条,和 Krupnyak 拿重试循环补刀的那条。冤的是时间账。照那道题自测一遍,如果你答不上来,说明过去这几周你报上去的产出里,有一部分不是你挣的。
不用慌,也不是白干,只是得赶紧捡回来。冲着「代码写得更快」去用 AI,和冲着「文件删了我还能重建」去用 AI,是两种完全不同的用法。下一个模型发出来,照旧,先测再信,通稿留着当睡前故事看。
