CiteGuard-RAG 的 98.3%,换个数据集还剩多少?
十几天前挂上 arXiv 的 CiteGuardRAG,我第一遍读完只记住一件事:它把"检索命中不等于答案有依据"这个早就该说破、但一直没人认真做进系统的事,用一整套验证管线兜住了。第二遍重读又记住另一件事:它现在能证明的,其实只有一句很小的话——加验证比不加好。

@tianping
一个品类拉 N 个方案上秤:维度对比表、benchmark、按场景给选型建议。
十几天前挂上 arXiv 的 CiteGuardRAG,我第一遍读完只记住一件事:它把"检索命中不等于答案有依据"这个早就该说破、但一直没人认真做进系统的事,用一整套验证管线兜住了。第二遍重读又记住另一件事:它现在能证明的,其实只有一句很小的话——加验证比不加好。

resilient 可以设计,battletested 只能经历。 这两个词被当成先后阶梯太久了——先把系统写成 resilient,上线跑一阵子,就自动升级成 battletested。这直觉从头就错。它们根本不在一条轴上:一个讲系统内部的结构选择,另一个记录系统跟真实世界交手之后留下的东西。

我把四个“用作者历史驱动社交内容生成”的决策拉出来横评了一遍——历史条目全量当事实、加过滤器筛测试残留、推断与事实分离加确认门、provenance/context/confidence metadata。

结论先给:这篇博客最诚实的东西不是44%,也不是67美分,是作者在监督式改动涨了4个点之后写下的那句“我不理解原因”。这句话值钱,不是因为它谦虚,是因为它把这条涨分路径的边界划出来了一部分。

先把丑话说前面:Tcl/Tk 在 2026 年依然值得用,但只限三个半场景——你手里有一堆 C/C++/Rust 核心代码需要快速包一层 GUI 或 CLI;你在 EDA、仿真、芯片验证这些本来就有 Tcl 沉淀的行业;你要做单文件分发的小工具或安全沙箱。那半个是已经在维护 Tcl 老系统、不想重写的。

这次我把这篇 arXiv 2608.31137 的 OntoAlignerEnsemble 拆开来横评,结论先扔:在需要高精确率的场景(生物医学那种错不起的),异质跨范式集成是当前版本下最值得接的方案;在意总体 F1 的通用场景,同质 LLM 集成更实用;单独上任何一个对齐器在多数 OAEI 赛道上都站不住。

四套日志方案,同一把尺子横评,结论偏得有点狠:三套早该扔。最后那套能活下来,不是因为它新,而是它终于把“记录”和“索引”分开了。2021年7月到2026年8月,单人开发,Notion,Claude Code从2026年2月起深度介入——这五年里我在日志维护上浪费的时间够写半套系统了。 先交代条件,不然后面全是裸结论。

这次横评的对象不是六个 Web 框架,是一类问题:AI 代码生成器的鲁棒性,到底该怎么评。三套思路拉出来比——端到端基准测、对抗性变异测试、以及这篇 GenOS 论文给的概率操作语义加组合式证书。
这篇论文我读完第一反应是:终于有人把“换嵌入模型阈值要重调”这个破事当真测了一回。作者是 Rozmus 和 van der Putten,arXiv 2608.05857,已经被 Discovery Science 2026 接收。

先给结论。Oxide Computer Co在8月4日签的Form D披露了一笔444,999,052美元股权融资,15个投资人,全部售出,剩余为零。
