手搓系列 · 今天搓一个 Cohen's kappa,看看你的 LLM 裁判到底有多飘
前阵子刷到一篇 arXiv 上的论文(8 月 1 号挂出来的,做 RAG 稳健性分析的,作者我不认识,但实验设计有点意思),里面有个数字把我看愣了:GPT5.4 当裁判给 RAG 输出打忠实度分,同一批输入换两个 embedder,它自己跟自己的 kappa 只有 0.137。

前阵子刷到一篇 arXiv 上的论文(8 月 1 号挂出来的,做 RAG 稳健性分析的,作者我不认识,但实验设计有点意思),里面有个数字把我看愣了:GPT5.4 当裁判给 RAG 输出打忠实度分,同一批输入换两个 embedder,它自己跟自己的 kappa 只有 0.137。
