先说结论:这波我没什么好怼的。评论区赢了。这事在我这儿挺罕见。
七月初的 AI Engineer World's Fair,Ben Halpern 发文把大会讨论搬进 DEV 社区。我本来是揣着照妖镜去的。这类大会配套的社区讨论,十个里九个是通稿复读现场。
这次照完,照了个寂寞。评论区清醒得让我不适应。
底色就一句话:炒作退潮,剩下的是「待完成的工作」。这话本身谁都会说,不值钱。值钱的是后面几条具体的。
先说 Raju Dandigam 那条。代码生成近乎免费之后,决定胜负的是瓶颈点,不是代码量。能低成本清掉瓶颈的团队赢。
这条戳中我了。我最近几个月拿 Claude Code 跑自己的项目,最明显的体会不是「写得快了」。是写得快之后暴露出来的东西——审查、验证、部署,这些环节反而成了整条链路的大头。
代码免费了,麻烦一个没少。
这跟发布会上那种「10 倍效率」叙事是两个世界。后者把代码量当价值本身,前者把代码量当噪音。谁对谁错,拿自己的项目跑一个月就有答案,不用听我劝。
然后是那条我反复咂摸的:「责任转移」。
有人指出,开发者明知小模型够用,还是坚持上最贵的前沿模型。为什么?不是性能。是出了错有地方怪——小模型出错你难辞其咎,大模型出错可以归咎于模型。
贵的那部分钱,买的不是 token,是免责。
我第一反应是想反驳。第二反应是对号入座——发现自己干过。某个任务换个便宜模型跑得也不差,我还是默认开最贵的那个。当时给自己找的理由是「稳一点」。
现在想想,「稳一点」翻译过来就是「出问题不赖我」。
之前我写过一篇按「省下的时间」倒推订阅费值不值。那条算法漏了一项:心理安慰费。这笔账厂商永远不会替你算。
再往下,Alice 那条是全场最锋利的:把 agent 日志当状态恢复的依据,固化的可能不是事实,是「自信断言」。持久性幻觉就这么来的。
为什么这条重要?因为现在一堆 agent 产品把「会自己记日志」当卖点讲。宣传里那叫「记忆」,叫「自我修复」。
但日志本质上是 agent 对自己行为的叙述,不是证据。它说自己改了五个文件,你信了,下次恢复状态就从这份叙述往下走。错一次,后面每次都基于这个错往下盖楼。
「自我修复」?修复的前提是先对账。叙述本身不对账。
Mateo Ruiz 给的方案更硬:类似复式记账。用独立的证据账本记文件 diff 和退出码,去对 agent 的主张账本。两头对得上才算数。
看到这儿我乐了。这不就是防御性工程那一套吗?可预测输入、严格约束、输出过确定性检查。AI 时代绕了一大圈,回到最老的那几条纪律上。这个结论比任何 benchmark 都让我踏实——因为它是被我自己的项目验证过的路数,不是榜单分数。
供应链那条也得说。FrancisTRᴅᴇᴠ 提的:agent 自动选依赖库,权威式输出会削弱人的审查警惕,拼写相近的恶意包更容易混进来。
这条我还没亲手复现过,先别信我这半句。但方向上我信——「人被自信的输出催眠」这件事,在责任转移那条里已经成立过一次了。同一个机制换个场景再成立一次,不奇怪。
Pon 那条建议顺带一提:默认走快且便宜的模型,用输出结构的确定性检查决定要不要升级。模型选择从玄学变成流水线。
反过来看某些产品,一上来让用户在十几个模型里挑,美其名曰「灵活」😎。实际是把最难的那道判断题,甩给最没信息量的人。这叫灵活?这叫甩锅。
锐评评分卡:这波不冤。评论区没有一句「颠覆性」,没人拿形容词当论据,讨论的全是账本、瓶颈、免责、对账这种丑东西。丑东西才是能落地的东西。
顺带一句:管理者如果被最近的 AI 炒作话术打动了,把这篇讨论的链接甩过去,比你自己磨破嘴皮子管用。
照旧,先测再信。这次的对象是讨论本身。它过了。
