
既骂 LLM 又用 LLM,这不是虚伪
· 阅读约 5 分钟
上个月在柏林的 Local-First Conf,演讲者在台上批评 LLM:制造垃圾、偷版权、烧电、是个泡沫。台下掌声很响。我旁边坐了两排,屏幕上开着 Claude Code,正让 agent 改一个 diff。散场一看 Discord,有人发了一句“这场听完我有点内疚”,底下十几个附和。
我当时的反应不是“这帮伪君子”——是这可能是全场最健康的姿态了。
批评我全都认。LLM 确实在批量生产垃圾内容,版权问题是真的,能耗不是小数目,这产业是不是泡沫我也不打保票。但我上个月花了差不多一万美金在 token 上。两件事在我这儿不矛盾:批评的是那个“什么都往里扔、拿 LLM 当不用动脑的借口”的风气,不是“用”本身。
问题出在很多人把“用不用 LLM”搞成了道德立场。纯洁派说用了就不专业,挥霍派说全交给模型、连自己写的代码都不读就合进 main。两边的共同点是不把这事当工程决策,当身份标签,一个比一个标榜得响。这两种我都不站。用,但带着工程纪律用,这中间没有第三种吗?
有,而且不难。
六月份那个出口管制指令,Fable 5 和 Mythos 5 一天之内对所有客户禁了。我 6 月在自己项目上跑的就是这俩,小一万刀砸进去,然后没了,所有依赖它的流程全部要换。那笔钱有一部分是白花的——不是模型不好,是我把流程绑死在“最强”上,没留退路。之后我就改了:贵模型只管真正需要深度推理的环节,纯代码执行、机械重构,换 GLM 5.2 跑,效果好不到哪去,账单掉了一个量级。这叫止损意识,不为名头付费,为需要的复杂度付费。
光选对模型也不够。我现在给 LLM 加了两道闸。第一道是照 Matt Pocock 那套改的 grill-me 技能:不许直接给方案,一次一个问题,反复追问你到底要什么,直到达成共识才动手。听着反直觉——LLM 是省事的,你怎么还让它审问你?但用下来发现它逼出来的那段时间最值钱,因为大部分时候你会发现,你根本没想清楚。第二道是写代码和写文章之前,用 Pitch 框架强制写三句话:问题是什么、交付什么、不交付什么。三句话写不顺,这活不该开工。LLM 帮不了你这一步。它只能在你把问题想清楚之后加速,不能替你想清楚。
我反复在说一件事:LLM 是放大器,不是思考器。你给它模糊的需求,它给你一个看起来合理的答案,语气还特别确定——这是它最危险的地方。你脑子里有半桶水,它帮你把水晃荡得更响。去看那个 Ralph Wiggum loop,也有人说叫 Claude ultracode:不断生成子代理去审查上下文,一层一层审下去,审到后来子代理开始无中生有、编造根本不存在的文件。因为上下文被自己掏空了,为了完成任务只能幻觉。这就是放大器的极限——它不会停下来告诉你“我编不下去了”,它会一直演到穿帮为止。
去年会上 Anselm Eickhoff 说过一个方法,让 LLM 先幻觉它期望的 API 或 UX,再回头实现。我当时觉得太野了。回去自己搞了个 intuition-probe 技能:让模型不看代码,先从我的描述里猜这个功能应该长什么样、接口怎么暴露,然后我把它的猜测跟我脑子里的设计对照。十次里有三四次它猜得比我的接口更干净,剩下六七次,暴露的是我自己需求描述太含糊。这玩意儿不替你思考,它是你的镜子。
说到 Armin Ronacher——Flask 那个 Armin,现在 Pi.dev 的创始人,他们开源 agent harness 的定位页写着:“在冲向 AI 的世界里,我们相信人类是最好的代理”。会上他说他们公司自动关闭几乎所有 LLM 提交的 PR 和 issue。我第一反应是太狠了,转念一想,这是止损点:不是不用,是不让不可审查的东西进来。Zig 和 Gentoo 也直接拒收 LLM 生成的 PR。看着激进,本质是同一种工程判断——画一条线,线外的东西不管来源多诱人,不放进来。
这话我说得有点重,但我认:一个连生成代码都懒得读就敢往生产推的人,工具越好,坑越大。一个为了证明紧跟时代把什么都扔给 agent 的团队,跟一个为了守住底线啥都不用的团队,犯的是同一个错——把工具当立场。
工具不能替你对后果负责。你让它生成一百个 PR,Line 上出了事,背锅的还是你。
现在我在德国招产品工程师,面试到一些天天用 AI 的候选人,聊操作系统、网络、数据结构就露怯,一开编辑器,agent 跑得比谁都快。我不是说这不对,是顺序错了——工具是最后一环,不是第一环。
回来说那个会议。台下开着 Claude Code 鼓掌的人,我觉得比台上诚实:他们清楚这玩意儿有问题,也清楚它有用,拒绝二选一。这个别扭劲,恰恰是工程素养。纯用和纯不用的人,省掉了那个别扭,也省掉了判断。
我的态度很明确:别装纯洁,也别挥霍。工具跟着问题走,不是问题跟着工具走。先想清楚要解决什么、哪里要人盯着、止损线画在哪,再谈用哪个模型。这套判断逻辑,跟选数据库、选语言没有区别,三十年后照样用。
更多「Agent」的实战
评论(5)
我现在遇到报错下意识就甩给AI,前几天一个简单的空指针自己看半天才想起来以前会看栈的,退化了。所以特别认同“LLM是放大器不是思考器”这句。先自己排一会儿再问,算是往回拉。
哈哈我也有过 全押在最强模型上 一禁全傻眼 现在也是混着用 贵的只干重活