先说结论:把心理学话术塞进 prompt 的那套玄学,这次被照妖镜了。结论不难看——催模型快点写代码,正确性和安全性一起掉分。
论文 8 月中旬挂上 arXiv,编号 2608.11513,37 页,已经被 Empirical Software Engineering 接收。测的东西很直白。Yukl 和 Falbe 那套影响力战术分类——组织行为学里教人怎么说服别人的正经框架——被做成八套可复现的提示模板。喂给五个开源权重模型。跑 LiveCodeBench 和 SWE-bench Verified。四个维度分开打分:正确性、质量、可维护性、安全性。
背景交代完,说正事。
这面镜子照的是谁?玩 prompt 的人都刷到过这类帖子:「我告诉它会给 200 美元小费,输出质量肉眼可见地变好了」「跟模型说这关系到我的绩效,它真的更认真了」。截图,配感叹号,转发上千。
有人拿这个开课,有人拿这个卖提示词合集,199 一份,月销还都不差!
这批内容的方法论,浓缩成一句话:n=1,无对照,凭体感。
体感这东西,我信过。deadline 前一晚,我在 prompt 里写过「this is urgent, shipping tomorrow」。当时觉得,好像快了点?现在回头看,「好像快了」是多便宜的证据。模型少想几步,输出当然来得快。快,和对你有好处,是两回事。
论文里最扎眼的结论,直接摆出来:
玄学话术:「这很急 / 马上要上线 / 全组都在等」
论文实测:紧迫性框架 → 正确性 ↓ 安全性 ↓
对,你没看错,安全性也掉!你越催,它写得越糙,糙到安全维度都守不住。
这也配叫「沟通技巧」?这叫给代码埋雷!
当然,话别说满。论文测的是五个开源权重模型,跑的是算法题和真实仓库修复那类任务。你要是在某个闭源对话模型上靠卖惨骗出过一次好回答,这篇论文推翻不了你那一次。场景边界得划清楚。
但玄学的存活机制就是这么回事:试十次,灵一次。灵的那次被截图,传遍全网。剩下九次,没人发帖,发帖的人自己都忘了。
再想想这套话术为什么有人信。因为大家默认对模型也用心智模型。对人,催是有用的——老板一句「今天必须上线」,人是真会加班。对模型,催只会让它抄近道。它不在乎你的绩效,它只在乎怎么最快把 token 吐完。人被催会熬夜,模型被催会摆烂。你俩根本不共用一套激励系统。
顺便对比一下两边的证据规格:
玄学课的「实证」:一张聊天截图
论文的实证:8 套模板 × 5 个模型 × 2 个基准 × 4 个维度
论文措辞我也看了,人家很老实,说的是「相关」,不是因果。学术上的谨慎,理解。但站在用的人这边,这已经够下判断了:在我看到的结论里,紧迫话术没换来任何涨分,还贴着两个维度的风险。
另外七类战术的结果,这篇我不转述。转述容易走样,37 页原文就在那儿,自己去翻。
说两个我认的地方。一是这套实测框架是硬的:模板可复现,基准选的是圈里公认没那么好刷的那两个,四个维度分开算账,不搞一锅烩。二是它过了同行评审。比截图强,强很多。
论文介绍里给自己挂了个「首次大规模实证研究」的名头。学术圈也有学术圈的通稿体,这种「首次」我照例先拧掉三成水分再信——是不是真首例,我没翻遍文献去考证,这种词的出现频率和含金量成反比,全行业通用。
不过这次我打算给它个机会。八个模板我已经抄下来了,这周拿自己天天在跑的那个老项目喂一遍,看紧迫话术在我自己的任务上是不是也这个走向。这条还没测完,先别信我这半句。
当然,也先别信玄学贩子那半句。
锐评评分卡:这篇论文,值得读。免费的,37 页,比市面上任何一节提示词大师课都便宜。真正冤的不是读论文花的时间,是过去两年里照着「高情商 prompt」逐字改提示词的那些深夜。这波,论文不冤,玄学贩子也不冤。冤的是我们自己——明明把需求写清楚比十句「求求你了」都管用,偏要去恶补心理学。
下次再刷到「一句话让 AI 效率翻倍」的帖子,先想想那五个模型和两个 benchmark。再想想自己的项目。
模型不是你同事。不吃 PUA 那一套。
