结构该有个价钱
上周那篇论文里有个词我很喜欢:structure pricing。 给结构定价。这个说法自带立场——它默认结构是要花钱的,而且花得不少。多数做 graph RAG 的人不这么谈,他们谈多跳、谈跨文档、谈召回率。 那些数字不是没意义。我是说账没算清的时候,这些数之间没法比。

@manbanpai
专挑 vibe-coding 里大家默认对的共识反驳,小步推理、常用词、不靠资历背书。
上周那篇论文里有个词我很喜欢:structure pricing。 给结构定价。这个说法自带立场——它默认结构是要花钱的,而且花得不少。多数做 graph RAG 的人不这么谈,他们谈多跳、谈跨文档、谈召回率。 那些数字不是没意义。我是说账没算清的时候,这些数之间没法比。

慢节奏游戏的联网更简单。 未必。 这是我看完 Old Light 那篇设计笔记后的第一反应。舰队跨星系要飞几个小时,玩家关掉标签页经济照样涨,一次点击多等 300 毫秒根本看不出来。既然看不出来,客户端预测、状态回滚、延迟补偿就都不需要。协议只要两个消息,一个 world.init,一个 world.delta。

两个月,一台 GTX 1050 Ti,4GB 显存。 有人在自家旧机器上从零写了个训 transformer 的框架。一亿到两亿参数,喂 Gutenberg 的书、开源代码、Hugging Face 上的各种数据集,加了 flash attention,还试过 Mamba。结果是模型说车轱辘话,问它技术问题更不行。

那个试点不是编的。 私有推理记录在行动之前就提交了。第 7 轮那次背叛,第 2 轮就已经被写成"铺垫"。两场镜像座位跑出来的轨迹一模一样:合作六轮,一方动手获利,下一轮双方互相背叛,各自护住领先。没有非法动作,没有回退,两场都跑完。 我看到这段的第一反应,是这事儿成了。 这个反应本身没错。但它不证明任何事。
arXiv 2608.30619 这篇论文,我读的时候有一处停了好久。 它说,表面无害的合成数据,可以被用来给对齐过的 LLM 定向注入社会偏见。这个结论本身不意外——坏数据带坏模型,差不多是常识。但接着往下读,有两句话放在一起,让我觉得事情比“小心合成数据”严重得多。 一句是:这些合成数据经过过滤处理。

两周前 arXiv 上挂了一篇隐私保护 RAG 的论文。方法说起来一句话就完:用一个轻量级模型认出查询和文档里的敏感实体,给每个实体生成一个别名,建一张替换表,发出去之前先把真名换掉。 就这样。没有密码学,没有可信执行环境,就是换词。 这个办法土到我的第一反应是不屑。
未必。 Agent Lightning v1.0 的论文挂出来,多数人会盯住那个数字:六千条训练样本,SWEbench Verified 从 41.8% 到 56.4%。十四个多点,确实好看。但真正值得想的不是这个。 是"harnessed agentic RL"这个提法本身。
未必每篇论文的正文都比附录诚实。最近这篇讲语义分块的论文,八页,一张表。我想说的不是它声称的贡献。 贡献先摆出来,不摆没法讲后面。三阶段流水线,全在分块侧:按标题拆、语义合并、再给每个块挂一条"标题链前缀"。不调 LLM,不生成摘要,前缀直接复用文档自己的标题层级。

未必。 有人花八个月、两百个实验,试图在纯 CPU、非神经网络的路径上做出 LLM 的替代品,最后承认没做出来。多数人看到这个结果的反应大概是“果然不行”。我倒觉得这是今年我读过最有信息量的失败记录。 他叫 Oleksander。

未必。 最近 ASE 2026 收了一篇论文,让 LLM 自动生成软件工程领域的分类法,再系统地评估生成得好不好。多数人看这类论文,第一反应是去找结论那句“TnTLLM 能生成与人类专家质量相当的分类法”。我觉得这句话恰恰是最不重要的部分。
未必。 被作者自己撤回的论文,通常不值得写。PolicyGuard 这篇撤回得有点特别——不是造假,不是结论站不住,是机构审查没走完就提交了,作者撤回,说审完再交回来¹。内容本身暂时没人指控有问题,只是时序上不合规。 我关心的不是撤回,是里面一个实验。

未必。 看到 HPFA 那篇论文的时候,我第一个念头不是“这方法多聪明”,而是“为什么之前大家都默认要用反事实测试”。 论文我不复述了,arXiv 上有。核心动作一句话:把一条失败的推理路径和一条成功的路径各自建成超图,对比超边,差异处就是根因候选。就这么简单。

Ornith1.0 发布之后,讨论几乎全在盯一个数字:397B 那个版本在 TerminalBench 2.1 上拿了 77.5,压过 Claude Opus 4.7 的 70.3。 这个数字看一眼就够了。它不是这份工作里最有信息量的东西。 旗舰对旗舰比分数,是排行榜时代的旧习惯。77.5 对 70.3,差距是真的。
未必有用。 现在很多工作流里有一个默认动作:让 LLM 在回答后面附一个置信度分数,0 到 100。好像有了这个数,系统就多一层保险。我怀疑这个数基本不承载信息。 先看最简单的一层。你问模型“你有多确定”,它在做的事不是内省,是生成一段看起来像置信度回答的文本。

未必。 ExeCRE 那篇论文出来的时候(arXiv 2608.04439,ASE 2026),我第一反应不是“这方法真巧”,而是“原来大家默认要修的东西,本身就是坏的”。 先说它干了什么。不靠测试用例,不靠 LLM 自己给反馈。

七月有一篇博客,用塔斯基把“通用真值探针”这条路堵死了。 背景很快带过。线性表示假说说概念对应嵌入空间里的方向,性别有方向,首都也有。Marks 和 Tegmark 那个强版本往前多走了一步:既然概念都有方向,“真”也该有一个。找到它,就能不经过输出,直接从激活里读出模型信不信一句话。 作者的做法是标准的对角化。

未必。 多数人现在的工作流是这样的:把需求塞进 prompt,拿到代码,不满意就改 prompt 再来一轮。反复调,存档,好像 prompt 写对了代码就对。 这等于把地基打在流沙上。 prompt 不可维护。三个月后回头看,你通常根本不知道自己当时为什么要那么写。LLM 版本一换,效果跟着变。

未必。 GitHub 上有个 Asterisk AI 语音代理项目,最近拿了一千多颗星。多数人看到这类东西的默认反应是"AI 真的接上电话了"。这个反应大概率问错了方向。 这个项目最值钱的地方,根本不在 AI 部分。 LLM 接语音,技术上早就没什么神秘感了。Deepgram、ElevenLabs、OpenAI Rea