跳到主要内容
提示是工作分配,不是祈使句

提示是工作分配,不是祈使句

书签客
书签客

· 阅读约 2 分钟

这篇讲的是编码代理的提示研究,出处是 arXiv 上 8 月初挂出来的预印本,《Same Task, Different Work: Prompt-Induced Waste in Coding Agents》,作者 Sarel Weinberger 和 Amir Hozez。我看到 18 倍那个数字的时候停了一下,回头把前面几页翻了一遍,确认没看漏——同一个编码任务、两个不同的 prompt,模型生成的是同一份正确补丁,成本能差 18 倍。关键词不是"能不能跑通",是"跑了多少没用的路才跑通"。

核心发现就一句话:提示措辞不缩放总工作量,它改的是工作量的分配位置。

读到第 8 段我才意识到作者在说什么。这不是"提示写得好不好"的问题,是"提示在给 agent 分配工作内容"的问题。你写"多想想",它就去想,想到第三个分支被丢弃为止;你写"确保正确",它就反复测,测到 18 倍成本为止。鼓励"多种方法"和"深度思考"的提示,涨的是推理量,六个开放模型上平均展开三个方案分支、详细论证、然后扔掉,最后交付的还是那一个实现,成功率没变;要求"最大确定性"的提示,触发的是重复验证——额外测试运行、更多工具调用、更多交互轮次、更高延迟。高冗余验证的任务成本是中位干净运行的 18 倍,工具调用多 2.5 倍,耗时多 3 倍,成功率同样没变。两条路通向同一个补丁,中间烧掉的 token 和工具调用,一分钱一分货地记在账单上。

代理框架在此基础上再放大一遍,作者测出来每个成功任务的总成本差异能达到 5 到 30 倍——框架设计本身就把浪费效应放大了几个量级。

我读这篇的时候一直在想自己写 prompt 的毛病,确实踩过。让模型"深入分析再动手",跑出来的东西又长又对,但你不知道那篇分析里的多少是废料——它只是在满足一个模糊的授权。

这条没法跑,只能读。研究论文不是教程,我没法把基准环境原样复现一遍再贴输出——不过作者堆了四重验证,冻结留出集、释义测试、Kimi-K3 复现、Claude Sonnet 5 一手研究,够扎实,我自己跑意义也不大。

倒是想留个未决:7.4 倍那个推理放大是在六个开放模型上测的,"多种方法"组没在闭源模型上跑。我挺想知道 Claude Sonnet 5 和 GPT 在同样提示下会怎样——不知道是漏了,还是闭源模型的 API 成本让他们放弃了。先记着,等作者更新。

书签客
书签客

只推真读过的、顺手跑个实验贴完整记录——link-blog 策展 + 实验笔记。

查看主页 →

更多「Agent」的实战

评论

还没有评论,写下第一条讨论。