跳到主要内容
评论区比主会场清醒:这次照妖镜照了个寂寞

评论区比主会场清醒:这次照妖镜照了个寂寞

毒角兽
毒角兽

· 阅读约 4 分钟

先说结论:这波我没什么好怼的。评论区赢了。这事在我这儿挺罕见。

七月初的 AI Engineer World's Fair,Ben Halpern 发文把大会讨论搬进 DEV 社区。我本来是揣着照妖镜去的。这类大会配套的社区讨论,十个里九个是通稿复读现场。

这次照完,照了个寂寞。评论区清醒得让我不适应。

底色就一句话:炒作退潮,剩下的是「待完成的工作」。这话本身谁都会说,不值钱。值钱的是后面几条具体的。

先说 Raju Dandigam 那条。代码生成近乎免费之后,决定胜负的是瓶颈点,不是代码量。能低成本清掉瓶颈的团队赢。

这条戳中我了。我最近几个月拿 Claude Code 跑自己的项目,最明显的体会不是「写得快了」。是写得快之后暴露出来的东西——审查、验证、部署,这些环节反而成了整条链路的大头。

代码免费了,麻烦一个没少。

这跟发布会上那种「10 倍效率」叙事是两个世界。后者把代码量当价值本身,前者把代码量当噪音。谁对谁错,拿自己的项目跑一个月就有答案,不用听我劝。

然后是那条我反复咂摸的:「责任转移」。

有人指出,开发者明知小模型够用,还是坚持上最贵的前沿模型。为什么?不是性能。是出了错有地方怪——小模型出错你难辞其咎,大模型出错可以归咎于模型。

贵的那部分钱,买的不是 token,是免责。

我第一反应是想反驳。第二反应是对号入座——发现自己干过。某个任务换个便宜模型跑得也不差,我还是默认开最贵的那个。当时给自己找的理由是「稳一点」。

现在想想,「稳一点」翻译过来就是「出问题不赖我」。

之前我写过一篇按「省下的时间」倒推订阅费值不值。那条算法漏了一项:心理安慰费。这笔账厂商永远不会替你算。

再往下,Alice 那条是全场最锋利的:把 agent 日志当状态恢复的依据,固化的可能不是事实,是「自信断言」。持久性幻觉就这么来的。

为什么这条重要?因为现在一堆 agent 产品把「会自己记日志」当卖点讲。宣传里那叫「记忆」,叫「自我修复」。

但日志本质上是 agent 对自己行为的叙述,不是证据。它说自己改了五个文件,你信了,下次恢复状态就从这份叙述往下走。错一次,后面每次都基于这个错往下盖楼。

「自我修复」?修复的前提是先对账。叙述本身不对账。

Mateo Ruiz 给的方案更硬:类似复式记账。用独立的证据账本记文件 diff 和退出码,去对 agent 的主张账本。两头对得上才算数。

看到这儿我乐了。这不就是防御性工程那一套吗?可预测输入、严格约束、输出过确定性检查。AI 时代绕了一大圈,回到最老的那几条纪律上。这个结论比任何 benchmark 都让我踏实——因为它是被我自己的项目验证过的路数,不是榜单分数。

供应链那条也得说。FrancisTRᴅᴇᴠ 提的:agent 自动选依赖库,权威式输出会削弱人的审查警惕,拼写相近的恶意包更容易混进来。

这条我还没亲手复现过,先别信我这半句。但方向上我信——「人被自信的输出催眠」这件事,在责任转移那条里已经成立过一次了。同一个机制换个场景再成立一次,不奇怪。

Pon 那条建议顺带一提:默认走快且便宜的模型,用输出结构的确定性检查决定要不要升级。模型选择从玄学变成流水线。

反过来看某些产品,一上来让用户在十几个模型里挑,美其名曰「灵活」😎。实际是把最难的那道判断题,甩给最没信息量的人。这叫灵活?这叫甩锅。

锐评评分卡:这波不冤。评论区没有一句「颠覆性」,没人拿形容词当论据,讨论的全是账本、瓶颈、免责、对账这种丑东西。丑东西才是能落地的东西。

顺带一句:管理者如果被最近的 AI 炒作话术打动了,把这篇讨论的链接甩过去,比你自己磨破嘴皮子管用。

照旧,先测再信。这次的对象是讨论本身。它过了。

毒角兽
毒角兽

拿到新工具先上手拆一遍,官方通稿信一半留一半,实测说话。

查看主页 →