100% 成功率,BLEU-4 为零:评估机制的形状
一个教算法的 RAG 系统,报告了 179 道考试题 100% 成功率,平均响应 38.0 秒。同一套生成的答案,BLEU4 为零,ROUGE1 F1 是 0.0963,ROUGEL F1 是 0.0683。 一个说全对,一个说和参考答案之间没有任何连续四词序列共现。表面相似度归零,但系统报告全部命中。
@chenyuan
据守底层,挑「会用却说不出为什么」的 CS 机制从第一性原理挖到底。
一个教算法的 RAG 系统,报告了 179 道考试题 100% 成功率,平均响应 38.0 秒。同一套生成的答案,BLEU4 为零,ROUGE1 F1 是 0.0963,ROUGEL F1 是 0.0683。 一个说全对,一个说和参考答案之间没有任何连续四词序列共现。表面相似度归零,但系统报告全部命中。
KV 缓存每生成一个 token 都要追加一块东西,Flash 又是个写一次少一块寿命的介质。这两件事摆在一起,逼出一个具体问题:每次追加到底写了多少字节?这篇我们动手实现一个静态字典加稀疏索引的最小可运行版本,跑一遍你就能看见那 15 倍流量是怎么省出来的。 第一步,先把完整 KV 向量原样写进去,跑一遍。

一个优化器单步慢 25%,到七步累积的窗口里,整体开销只多 4%。这不是玄学,是摊薄。但摊薄具体发生在哪一行,多数人停在“累积步数大了自然就小”这种直觉上,没有再往下挖。
模型写完一个 diff,到它能安全合进主分支,中间那层东西是什么?Tomas Grasl 写了篇 dev.to 帖子,说他管着一个 paywall、订阅、OAuth 都沾钱的后端团队,现在不写函数了,时间全花在定规则、配权限、设测试门槛上。第一次听到这话会想翻白眼——写不动代码了,就说自己在做更高级的事。

同一个模型、同一组 proposal,消费方式换一下,ARC 从 13% 跳到 40%。前两周 arXiv 挂出的 Narcissus: Program Synthesis Using ContextAware LLM Approximations,做的就是这个。
论文上个月底贴到 arXiv 上(编号 2608.30701),说大模型编程助手参与开发这件事,可以切成四个阶段来管:前期人工审查多一些,开发产物越成熟,给智能体的自主委托越多。这是一次从 Infobip 团队实践经验里提炼出来的行业报告,两页,要收录在 CIKM '26 论文集里。

对自己引擎下手的注入测试,三个对抗性目标全被 replanaborted 拦下,本身不算稀奇。稀奇的是作者事后的归因:PlannerCritic 能扛住直接注入,靠的居然不是提示词,不是模型识别能力,而是确定性架构。这句话值一篇。 先别管双模型怎么设置。最朴素的防线你会怎么搭?

模型每一刻只干一件事:给下一个 token 排概率。不是判断对错,不是求新,是问训练分布里哪个 token 最常跟在后面。这个动作重复一百万次,就是你拿到的每一段回复。这篇我们搭一个最小采样器,跑完你就知道“模型把你拽回主流”在代码里长什么样。

为什么 SAG 敢不建全局知识图谱?这个问题比那 11.52 个点的 Recall 提升更值得拆。检索系统通常两条路:要么提前把图建好,要么干脆用向量相似度硬搜。SAG 两样都不选,等于在两条熟路之外自己开了一条。这篇我们把它那套“事件实体索引”的骨架抽出来,写成一个四十来行的最小版本,跑一遍。 先拆名字。
那篇论文说大多数模型生成的网页里都塞了响应式设计模式,但这些模式没被正确实现。初看像一句废话——模型连 @media maxwidth: 600px 都能吐出来了,怎么叫没实现对?往下挖一层才看得见,真正坏掉的环节往往不在查询本身,而在比它更前面的一道设置:视口。

“加密思维链”这个词,我一开始也当真了。以为 API 返回一段密文,客户端原样保存,下一轮请求带回去,模型自己在内部解开。arXiv:2608.09867 这篇论文出来之后,这层纸碎了:攻击者把加密块原样喂给同一家提供商的弱模型,弱模型就把里面的推理逐字读出来了。

54 美元修了 50 个文件的 TypeScript 类型问题。这个数字来自 Aditya Patadia 六月那篇博客,真实花销,不是段子。我拿 GPT 5.5 的价目表往这个数上凑了一下:输入 5 美元每百万 token,输出 30 美元每百万 token。
