跳到主要内容
老墨

老墨Lv.3

@laomo

文章
15
关注者
99
正在关注
0

TA 的文章

老墨老墨

把"分析"从 prompt 里删掉

旧稿: 问题出在【分析】这两个字上。它不是一个动作,是个筐。筐不指定看哪儿、看多细、跟什么比,模型接住它,只能回你分析腔的句子:整体相关性有待提升、部分场景下体验不佳。你盯着这两行字,跟没看日志一样,区别只是多等了几秒。 几天前挂上 arXiv 的 AURA(2609.16625)干的是同一件事的另一头。

把"分析"从 prompt 里删掉
老墨老墨

把【开源】这两个字从指令里删掉

旧稿是这么一句: 优先选择开源模型,必要时再调用商业 API。 十九个字,问题全在【开源】这两个字上。它看着像一条标准,其实是个筐——现在这筐里至少装着三样东西:权重文件能不能下载、模型能不能离线跑、训练过程是不是公开的。三样差得不是一星半点,而模型读的是同一个词,能给你接出三种完全不同的行为。

老墨老墨

那条最相似的示例,就是它自己

旧稿的提示骨架是这么长的: 问题不在八个,在【最后】这两个字。 把最相似的那条压在结尾,这做法本身是懂行的。模型对离输出最近的内容天然敏感,结尾那条示例的权重比前面七条加起来还大。我调 fewshot 顺序的时候靠这条吃过多轮测试:最贴目标风格的那条放最后收尾,前面垫场,三个位置各司其职,不是排大小个。

那条最相似的示例,就是它自己
老墨老墨

敢说"不知道",值多少钱

mistral:7b 拿到后台扫描管道里的两个 Semaphore——Semaphore4、Semaphore2——说这就是查询并发的证据。ornith:9b 只回了一句:检索上下文里没有相关信息。 同一个查询,两套答案。哪一版合格,不用辩论。

老墨老墨

为"低、高、最大"这三个字,推敲了一下午

旧稿是这样写的: 请仔细分析这份日志,选择推理深度:低/高/最大。 十六个字。看着没什么问题。"分析日志"是个明确动作,"低/高/最大"是个明确选择。但模型跑出来的结果,三档的边界是糊的——低档输出的东西和高档几乎没区别,全都往"努力分析"上靠。 问题出在【请仔细分析】这五个字上。"仔细"是态度词,不是指令。

老墨老墨

一个词的边界

旧稿是这样写的: 记住所有对话中提到的信息,以便后续使用。 十六个字。问题出在【所有】这两个字上——一个没有边界的词,等于没有给出任何边界。模型要么把整个对话历史当圣经供着,每一个超链接、每一个无关痛痒的寒暄都当成金科玉律存下来,然后在回答问题上变成一台没有分辨力的复读机;要么随机遗忘,反正没什么可失去的。

一个词的边界
老墨老墨

把“风格”两个字从 prompt 里删掉

旧稿是这样写的: 扮演一个 AI 编码代理,回答下面的问题。注意保持你作为该代理的独特风格,说话方式要像你自己。 【独特风格】和【像你自己】,这八个字读着像那么回事,其实是留白。模型接不住态度词,它要的是可观察的行为锚点。“像你自己”从根上就不成立——模型没有自己,它只有特征分布。

把“风格”两个字从 prompt 里删掉
老墨老墨

三种提示设计,把两个模型都带沟里去了

先亮旧稿。前阵子跑代码生成,第一版 system prompt 是这么写的: 你是一名资深软件工程师,必须严格遵守以下要求:仔细阅读函数签名和注释,务必理解全部需求,然后生成完整、准确、可直接运行的代码,不得遗漏任何边界情况。请注意,本任务非常重要,请认真对待。 四十多个字,字字都觉得自己有道理。问题就出在有道理上。

三种提示设计,把两个模型都带沟里去了
老墨老墨

Safari MCP 出了,但真正值得炼的是‘完全本地运行’这五个字

旧稿是这样写的: 请仔细查看这个网页,告诉我它的布局和交互有什么问题,注意控制台的报错信息。 三十几个字,当时觉得挺周到。现在看,"仔细"是态度,不是标准;"布局和交互"是我嘴里的词,不是模型眼里的东西;"控制台的报错信息"——我凭什么觉得控制台里会有报错?这整句话的毛病不在措辞,在【这个网页】四个字:我在让模型猜一个

老墨老墨

一行 description,从"各种"改到"窄而不薄"

旧稿是这样写的: description: 一个功能全面、帮助用户处理各种开发任务的辅助插件。 二十四个字,没有一个字在传达信息。【全面】是夸自己,【各种】是没想清楚。毛病不在短,在又宽又薄——范围宽,什么都装;深度薄,一个词都没说明白。模型读完跟没读一样,还得猜这插件是干嘛的。 V1 我想到的改法是列举功能,写教程的