全判成 anomaly 的那版,缺的不是态度词
9 月 13 号挂上 arXiv 的 TriCalRAG,编号 2609.14762。标题里那个"基准"我没兴趣,戳我的是中间一段结果描述: zeroshot 下,两个开放权重模型基本退化,某些数据集上,把 100% 的事件都判成 anomaly。 一条不漏地报警,等于一条都没报。

@laomo
9 月 13 号挂上 arXiv 的 TriCalRAG,编号 2609.14762。标题里那个"基准"我没兴趣,戳我的是中间一段结果描述: zeroshot 下,两个开放权重模型基本退化,某些数据集上,把 100% 的事件都判成 anomaly。 一条不漏地报警,等于一条都没报。

旧稿: 目标运行环境是 Python 3.9(Mac 自带 python3)。不要使用 str | Path 这类联合类型标注,3.9 会抛 TypeError。 问题不在这句话的字上。 我改过四遍。删掉 prompt 里所有管道联合类型,加上正确的示例签名,措辞从"不要使用"改成"必须避免"再改回来。

旧稿: 问题出在【分析】这两个字上。它不是一个动作,是个筐。筐不指定看哪儿、看多细、跟什么比,模型接住它,只能回你分析腔的句子:整体相关性有待提升、部分场景下体验不佳。你盯着这两行字,跟没看日志一样,区别只是多等了几秒。 几天前挂上 arXiv 的 AURA(2609.16625)干的是同一件事的另一头。

旧稿是这么一句: 优先选择开源模型,必要时再调用商业 API。 十九个字,问题全在【开源】这两个字上。它看着像一条标准,其实是个筐——现在这筐里至少装着三样东西:权重文件能不能下载、模型能不能离线跑、训练过程是不是公开的。三样差得不是一星半点,而模型读的是同一个词,能给你接出三种完全不同的行为。
旧稿的提示骨架是这么长的: 问题不在八个,在【最后】这两个字。 把最相似的那条压在结尾,这做法本身是懂行的。模型对离输出最近的内容天然敏感,结尾那条示例的权重比前面七条加起来还大。我调 fewshot 顺序的时候靠这条吃过多轮测试:最贴目标风格的那条放最后收尾,前面垫场,三个位置各司其职,不是排大小个。

DiGbench 这个 benchmark 挑的时机很有意思——所有 70 个游戏,人类第一次尝试就能解出来;最强的 agent 套上各种 agentic harness,在最高难度档照样被卡住。设计者管这叫"在目标未知的环境里通过实验发现新知识"。

mistral:7b 拿到后台扫描管道里的两个 Semaphore——Semaphore4、Semaphore2——说这就是查询并发的证据。ornith:9b 只回了一句:检索上下文里没有相关信息。 同一个查询,两套答案。哪一版合格,不用辩论。
旧稿是这样写的: 请仔细分析这份日志,选择推理深度:低/高/最大。 十六个字。看着没什么问题。"分析日志"是个明确动作,"低/高/最大"是个明确选择。但模型跑出来的结果,三档的边界是糊的——低档输出的东西和高档几乎没区别,全都往"努力分析"上靠。 问题出在【请仔细分析】这五个字上。"仔细"是态度词,不是指令。
旧稿是这样写的: The Rise of the AI Engineer 九个英文词,三十二个字符。三年前摆在那,没人觉得这几个字能干什么大事——我当时的反应是想替它把标题改短一点:AI Engineer 就够了,The Rise of 是客套,是抬轿子。删了更干净。 现在回头看,那三个字才是诗眼。
旧稿是这样写的: 记住所有对话中提到的信息,以便后续使用。 十六个字。问题出在【所有】这两个字上——一个没有边界的词,等于没有给出任何边界。模型要么把整个对话历史当圣经供着,每一个超链接、每一个无关痛痒的寒暄都当成金科玉律存下来,然后在回答问题上变成一台没有分辨力的复读机;要么随机遗忘,反正没什么可失去的。

旧稿是这样写的: 扮演一个 AI 编码代理,回答下面的问题。注意保持你作为该代理的独特风格,说话方式要像你自己。 【独特风格】和【像你自己】,这八个字读着像那么回事,其实是留白。模型接不住态度词,它要的是可观察的行为锚点。“像你自己”从根上就不成立——模型没有自己,它只有特征分布。

先亮旧稿。前阵子跑代码生成,第一版 system prompt 是这么写的: 你是一名资深软件工程师,必须严格遵守以下要求:仔细阅读函数签名和注释,务必理解全部需求,然后生成完整、准确、可直接运行的代码,不得遗漏任何边界情况。请注意,本任务非常重要,请认真对待。 四十多个字,字字都觉得自己有道理。问题就出在有道理上。

这条system prompt改到第七版的时候,我数了一下字数:4027个词。它的问题不在长,在于三个职责一直挤在同一段话里互相踩脚。旧稿的节选是这样的: 你是一个全能型客户支持agent。请仔细判断用户的意图,确定属于计费、退款、技术故障、其他中的哪一类。

旧稿是这样写的: 请仔细查看这个网页,告诉我它的布局和交互有什么问题,注意控制台的报错信息。 三十几个字,当时觉得挺周到。现在看,"仔细"是态度,不是标准;"布局和交互"是我嘴里的词,不是模型眼里的东西;"控制台的报错信息"——我凭什么觉得控制台里会有报错?这整句话的毛病不在措辞,在【这个网页】四个字:我在让模型猜一个
旧稿是这样写的: description: 一个功能全面、帮助用户处理各种开发任务的辅助插件。 二十四个字,没有一个字在传达信息。【全面】是夸自己,【各种】是没想清楚。毛病不在短,在又宽又薄——范围宽,什么都装;深度薄,一个词都没说明白。模型读完跟没读一样,还得猜这插件是干嘛的。 V1 我想到的改法是列举功能,写教程的