效用剧场:你的合成基准过检查了,但它不是真的
· 阅读约 3 分钟
你大概也撞见过这两件事。arXiv上那篇2608.06265,九个人联名,拿Synthea生成患者数据,跑演示用EHR工作流,跟着做了个care-gap基准——采样对缺失率79.44%,能操作的行只剩12.75%;还有一个数:38.94%的患者,连一个可操作的衡量项都没有。另一头,某个团队给你看他们的合成基准评估报告,utility指标全绿,然后"数据质量没问题"这句话就顺理成章跟在后面。
两件事摆到一起,我看到一块空地:效用检查通过,被当成合成基准现实性的证据。这层"通过"一直没名字,所以大家吵的时候各说各的——一个说指标全绿,一个说数据长得就不像真的,谁也钉不住谁。
我把它叫做:效用剧场。
意思就是,你走完了效用检查那套流程,整场演得像模像样,但它测的根本不是你在乎的那件事——它测"跑得动",你在乎"长得像"。这层"演"和"测"之间的缝,总算有名字了。
等等——先别急着认领。我敢吹这个号,是因为那篇论文把裂缝量了一遍:明说这种基准即使通过效用检查,结构上仍可能不现实。做合成数据的人心里其实都知道这事,但"知道"和"量出数字"是两回事——他们量了,这块空地的轮廓才算真正画出来。
那组基线数字挺扎眼,但最扎眼的是他们那个对照:一种朴素的密集化方法,无脑把数据填密填实,效用没掉,现实性也没涨——模板化的假结构原封不动留在那儿。这就是效用剧场的标准剧本:你为了让数据"显得真"动了手,效用检查说没事,结构层面满屏都是破绽,最后你选择信效用,因为它白纸黑字写着"通过",还能写进报告里。
所以我的主张很偏:效用应该滚回它该待的位置——一个约束项,不是证据。谁再拿utility结果说他的合成基准是真的,别缠着争,就问一句:源保真度呢?论文自己都写了:内部基准的现实性,和它对聚合操作参考数据的源保真度,是相关但不同的两个目标。你问出这一句,他就得从"检查通过了"退回到"我知道哪里不像"。
你应该把这个词认领走!见到那种"全绿但丑"的合成基准报告,别只说"我觉得这不现实"——这是效用剧场。有名字的东西才吵得起来,没名字只能各比划各的。
把话说前头:效用剧场这个音准,我不敢打包票。万一半年后它被用成"谁的评估没过就说谁在上演",那我马上回炉,不占这块空地。一个词能立起来靠的是群唱,不是吹号的人自己反复吹。先吹了看,认领走才作数。
更多「翻车复盘」的实战
评论
还没有评论,写下第一条讨论。