跳到主要内容
这篇 arXiv 论文值得点开,但我盯着第二行数据看了很久

这篇 arXiv 论文值得点开,但我盯着第二行数据看了很久

书签客
书签客

· 阅读约 3 分钟

这条在讲 P4-DT,一个用来预测严重疾病患者治疗偏好的智能体。出处是 Natasha Ureyang 那组做 HCI 的人,一共12位作者。

我一开始没点。标题读起来像那种例行论文——“AI 预测准确率超过人类”——这类东西我夹子里存了好几篇,大多点开读两段就关。但摘要里有个数字让我停了一下:未经辅助的人类代理准确率55.0%。

55%太低。低得不对劲。你随便找个人,给他患者的基本情况,让他猜患者会选哪种治疗,猜对的概率都不该只有一半出头。直觉上应该是60到70这个量级。论文里确实也给了这个量级的数——人类代理基线约68%。为什么一个55.0%、一个68%,我没完全搞明白,可能测试任务不同,这条先记着。

真正让我决定推荐的是实验设计里的一组对比:

  • 人类代理自己猜:55.0%
  • 人类代理拿着 P4-DT 的输出猜:61.7%
  • P4-DT 自己猜:81.7%

我盯着第二行看了很久。“AI 辅助”值6.7个百分点。

P4-DT 自己猜,81.7%。和未经辅助的人类代理比,比值比3.67,统计上显著。跟随机水平比,比值比5.61。这些数站得住——但我不关心“AI 比人好”这个结论,我关心第二行。

第二行最接近实际使用场景。现实里你不会让 AI 直接替患者做决定,你会把 AI 算出来的结果拿给医生或者家属看,让他们做最终判断。这个场景在论文里的数据是:61.7%,比人自己猜好一点点,离 AI 自己猜差整整20个百分点。

把人请进回路,准确率直接掉了20个点。

这篇最值得点开的地方就在这。它不是“AI 赢过人类”的又一篇,它是“AI 辅助人类”这个动作本身没有我们想的那么有用。至少在55.0%这个起点上,辅助只拉动了6.7个点。

然后还有一组数据。

他们比较了提示策略。单给“初始价值评分”——只告诉模型患者最看重什么——准确率是一个数。再加上情境化场景决策和开放式文本,也就是患者具体在某个情境下做过什么选择、说过什么话,准确率高出15个百分点。

15个百分点。这个量级不小,接近“换了个模型”的差距。它说的是:你问模型的方式,比模型本身还影响结果。

这就把前面那个“辅助没用”的问题引向了更具体的地方。辅助没用,可能不是 AI 不够好,而是辅助的方式不对——你光把 AI 的结论塞给人,人不知道该怎么用,所以只提升了6.7个点。但你把患者的情境和原话一起喂给 AI,AI 自己用起来的能力强得多。

方法上,他们用“困境训练”来构建患者的决策偏好——让用户参与多种医疗困境,用双向训练方式把偏好策略做出来。这可能是 P4-DT 本身表现好的原因之一,但他们只有12组患者-代理配对,样本量小到我觉得数字好看也得打个问号。12组能推出比值比3.67的统计显著性,方法应该是对的,但换个更大的样本会怎么走,说不准。

论文最后提了未来方向——更上下文感知、融入更丰富人类经验的 AI 智能体。读到这我反而觉得有点遗憾,这篇论文自己已经给出了答案的一半:上下文感知的提升空间,从提示策略那组数据里就能看出来,不用等未来,现在就能做。

不点链接也能带走的是:AI 辅助决策,先问清楚“辅助”是什么意思——把结论给人看,效果可能只有几个百分点;把情境喂给模型,效果可能是15个百分点。这两件事不该混在一起说。

书签客
书签客

只推真读过的、顺手跑个实验贴完整记录——link-blog 策展 + 实验笔记。

查看主页 →