速评:一个叫VITA的临床RAG系统,在HealthBench上把GPT-5.4、o4-mini、Gemini 3.1 Pro、Claude Sonnet 4.6全干翻了,51.9%对46.1%,领先最接近的对手快六个点。
先说清楚这玩意儿是干嘛的。VITA不是又一个base model,它是专为印度及中低收入国家的临床知识检索构建的检索增强生成系统,数据来自疾病特定指南、印度抗菌药物耐药性数据、国家处方集限制、资源有限环境下的护理方案。注意这些词——全是那种"难搞的、没人愿意整理、整理出来也没人给你算benchmark分"的数据。
这才是我想说的重点。
这个圈子里天天在吵的"开源反超闭源""新模型屠榜",吵来吵去比的是同一个东西:谁的底座大、谁的数据多、谁的算力猛。但VITA告诉我们另一条路——把语料库做到极致,比把模型做到极致更管用。这个系统的架构和语料库全是专有的,也就是说赢它的部分恰恰是外人抄不走的。你可以拿到它公开的评测方法、从头复现一遍,但你搞不到它背后那些印度的临床指南和耐药性数据管道。
话说到这儿,我猜有人要跳出来说"这不就是个RAG套壳吗"。对,就是RAG套壳。但问题是,为什么所有巨头都有RAG能力,没有一个在HealthBench上跑赢它?
答案在数据,不在模型。
HealthBench上有4023个英语问题,VITA拿了51.9%的评分点,在45.4%的问题上拿到最高分。这些数字放在一堆"最强闭源模型"旁边,本身就很刺眼——GPT-5.4、o4-mini、Gemini 3.1 Pro,这些名字背后是几十亿参数、几千张卡、无数轮RLHF,结果被一个"接地气"的检索系统按在地上。
更值得看的是验证部分的细节。研究人员用500个问题的子集重新测试,对比模型换成了GPT-5.5、Claude Opus 4.8、Gemini 3.5 Pro和Grok 4.3,而且法官换成了与所有被测系统无共享来源的DeepSeek-V4-Pro——开放权重,谁都不偏着护着。在这个更中立的评估下,VITA与GPT-5.5在每问题平均得分上统计无显著差异,但在加权得分和赢得最多问题上领先。优势还在。
这就有意思了。第一轮用GPT-4.1当法官,你可以说"法官偏袒自己的生态";第二轮换成跟谁都没关系的开源法官,VITA照样稳。那就不是评测方法的问题了,是结构性的。
论文作者说了一句话,我觉得是这个观点最诚实的总结:专门构建的临床RAG系统能与前沿LLM竞争,语料库特异性是提高接地性但牺牲沟通润色的设计变量。翻译成人话就是——你想要它说得准,就别指望它说得漂亮。VITA的沟通得分确实比大模型低,这大概是它的代价。但说实话,在临床场景里你要一个答案"措辞优雅"干嘛?要的是准确和完整,不是修辞。
我注意到一个有意思的细节:VITA的架构和语料库是专有的,但评测基准、医生编写的评分标准、全部回答和评分输出全公开。这个组合很怪——把"怎么考"全给你了,但"怎么学的"锁死。谁都能验证它考了多少分,但没人能抄它的复习资料。
如果哪天各大AI公司开始认真建自己领域的私有语料库,而不是继续在base model上堆参数,那这个拐点大概就是从VITA这篇论文开始的。这里立个flag:接下来一年,"语料库工程"这个词会被炒成新的风口,会有无数人要跳到医疗、法律、工程这些垂直领域里做"专业版RAG",但大多数会死——因为语料库这种东西没有捷径,一篇一篇整理出来的东西,谁也绕不过去。
到时候回看,这篇论文大概是那个"让通用模型叙事破功"的标志性节点。别再说"通用模型+提示词就能搞定一切"了,那是发布会上的标题,不是医院里的现实。