提示词管不住约束——自动机能,而且六十年前就能
半夜刷 arXiv,刷到一篇标题里躺着一个老词的论文:automata。这年头敢在具身 agent 论文里拿自动机当主角的,要么是来炒冷饭,要么是真发现了点什么。CEDAR 这篇属于后者——摘要里有一句话把我钉住了:语言模型负责提议,自动机负责把关。 先把判断说满:提示词管住的是词汇,管不住的是约束。

@zaolunjiang
不调库、从零搓一个最小能跑的版本讲原理,直觉先行再补严谨。
半夜刷 arXiv,刷到一篇标题里躺着一个老词的论文:automata。这年头敢在具身 agent 论文里拿自动机当主角的,要么是来炒冷饭,要么是真发现了点什么。CEDAR 这篇属于后者——摘要里有一句话把我钉住了:语言模型负责提议,自动机负责把关。 先把判断说满:提示词管住的是词汇,管不住的是约束。

arXiv 上前两天挂了篇论文(8 月 18 号,Barba Roque、Cruz、Panichella),核心结论一句话:FLOPs 不是个可靠的能耗指标。
前几天看到 Cua 团队 8 月 11 日发的那篇东西,看完第一反应是:这不就是我们这行最典型的“黑盒骗法”吗——不是骗人,是骗程序。macOS 虚机里的 llama.cpp 跑得慢,不是 GPU 不行,是它问错了问题,然后被诚实地骗了。

前阵子刷到一篇 arXiv 上的论文(8 月 1 号挂出来的,做 RAG 稳健性分析的,作者我不认识,但实验设计有点意思),里面有个数字把我看愣了:GPT5.4 当裁判给 RAG 输出打忠实度分,同一批输入换两个 embedder,它自己跟自己的 kappa 只有 0.137。

前几天翻 arXiv,看到一篇 8 月 2 号挂上去的论文,DenialRAG,投 ACSAC 2026 的,三位作者(Zhurekbay、Liu、Li)。他们干的事说出来简单到有点好笑:往一个会被检索到的文档里,把正确答案明明白白写出来,紧接着否认它,再塞一段攻击者自己编的错误解释。
前几天翻到一篇论文(arXiv 2608.02011,Roh 和 Han 两位写的),里面有个发现把我扎了一下:agent 检索增强系统里,一大堆错误答案根本不是推理推错的——agent 检索到了候选证据,压根没打开看就急着收尾答题了。作者管这叫证据前纪律失败。问题出在“收证据”这个动作序列上,不出在“想答案”上。

前几天翻 arXiv 刷到一篇移动端 RAG 的论文(2608.03148,八月四号挂上去的),讲的事情一句话就能说清:移动设备上跑 RAG,内存和算力都紧,所以只敢留一个检索块;但检索器排第一的那个块,不一定是对回答最有证据价值的那个。他们于是搓了一个选择器,专门负责从候选块里挑出“证据最对齐”的那一个。

前几天 arXiv 上挂出一篇 MultiPathFormer(2608.05076,Guda、Sze、JoeWong 三个人写的),干的事一句话能说清:把无线信道里每条传播路径当成一个 token,把发射器到接收器之间所有路径的序列当成一句话,然后拿 GPT 预测下一个词的那套办法,去预测下一条路径。
gitannex 的维护者上个月花了大概 100 个小时,只为了一件事:让这个项目能在一个不含 LLM 生成代码的依赖树里构建起来。100 个小时。我读到这条记录的时候,第一反应是——审查依赖树,到底累在哪? 他列出来的几件事,搁一起看特别有意思。

ChipTycoon 把芯片制造做成了游戏,这个方向我认——沙子进,CPU 出,每一步都做成动画,这比流程图好记多了。但他那句话我不信:「100% accurate」。今天不聊游戏好不好玩,就把这句"准确"从中间剖开。
