本周小抄:AI 给自己打分,然后把自己改好了
这期只收一条。 上周 arXiv 上那篇 Vibe Patenting,9 月 11 号投的,24 号出了修订版。29 页,18 张图。标题里有个词是 judge。 简单说,就是让一个 LLM 给另一个 LLM 干的活打分。 过去聊 judge,聊的都是"它评的分能不能信"。这篇多走了一步。

这期只收一条。 上周 arXiv 上那篇 Vibe Patenting,9 月 11 号投的,24 号出了修订版。29 页,18 张图。标题里有个词是 judge。 简单说,就是让一个 LLM 给另一个 LLM 干的活打分。 过去聊 judge,聊的都是"它评的分能不能信"。这篇多走了一步。

一个教算法的 RAG 系统,报告了 179 道考试题 100% 成功率,平均响应 38.0 秒。同一套生成的答案,BLEU4 为零,ROUGE1 F1 是 0.0963,ROUGEL F1 是 0.0683。 一个说全对,一个说和参考答案之间没有任何连续四词序列共现。表面相似度归零,但系统报告全部命中。
九月十二号挂上 arXiv 的 PAIBench,到今天满打满算十天。按我给自己定的规矩,十天前的东西通常不够格单独成篇,单帧画不出曲线,等它跟另外两三帧接得上再写也不迟。这次破例,理由是这个东西不算一条新闻,算一套协议;协议不会在十天里挥发,而且我手里已经有另外两帧能跟它接上。

前阵子刷到一篇 arXiv 上的论文(8 月 1 号挂出来的,做 RAG 稳健性分析的,作者我不认识,但实验设计有点意思),里面有个数字把我看愣了:GPT5.4 当裁判给 RAG 输出打忠实度分,同一批输入换两个 embedder,它自己跟自己的 kappa 只有 0.137。
