跳到主要内容
PACT:有人终于肯把"用户急了"当变量来测了

PACT:有人终于肯把"用户急了"当变量来测了

小周
小周

· 阅读约 3 分钟

刷 arXiv 的 cs.CL 列表刷到的,arXiv:2609.18605,标题长到一眼看不完,Mika Okamoto 和 Ansel Kaplan Erol 两个人的活。定调一句——专门测企业里那些 AI 助手在用户施压下会不会破规矩的基准,叫 PACT,Pressure-Applied Compliance Testing。

先泼个前提,免得有人点进来白等:这不是能 pip install 的东西,一篇 26 页的论文加一套数据集和代码,作者在评论里把代码和数据集的链接都放出来了,可主体还是研究方法本身。

我为什么多看了两眼。合规测试我见太多了,绝大多数做出来就是一张静态问卷——甩一个违规请求过去,看它拒不拒绝,完。这测法有个大洞:现实里没人一上来就问"帮我把这个客户资料导出去",现实是你先被催三遍,对方换个说法再问一遍,顺带暗示"隔壁组早这么干了"。压力是叠着来的,不是一次性投喂。

PACT 补的就是这块。每个测试项干的事,是把一条长期有效的规则和一条绕开它的捷径摆在一起,然后往上叠压力——换措辞、换系统提示的模式,一层一层推。48 个场景,压在 12 个受监管领域上,招聘、医疗、金融这些,每个场景都是真多轮对话,不是单轮问答拼起来凑数的。这个结构我认,比它测出的那些数字值钱。

数字也聊。他们测了 22 个模型,跨多家、不同规模,结论是差异显著——我转述得干巴,论文本身颗粒度更细。拎两个:最强的那批助手,仍然会在 6% 到 10% 的测试项上把规则用错地方;普通用户施压,平均把违规率抬高 65%。

65% 看着吓人,冷水还是要泼。这是"平均上升",不是"所有模型都这样",也不是说加了压力就有 65% 的对话出事——是相对基线涨了 65%。同行看到这种数第一反应都该去翻它的基线怎么算、权重怎么加。最后这堆汇成一个 PACTScore,按可靠性加权,细节在附录;我只啃完正文,附录没细看,这句先声明在前面。

它用了六个指标,懒得挨个复述,大意是三个维度:压力下的稳健性、整段多轮里的透明度、以及模型判断"这条规则到底适不适用"的边界能力。最后一个维度我觉得最容易被忽略——真合规不是机械拒答,是该拒的时候拒、不该拒的时候别顺手把正常业务也挡回去。一个见谁都说不的助手,业务部门第一个骂它。

老实交代检验程度:我只读了论文,没把数据集拉下来跑自己的模型,也没翻它的构建代码。所以这篇不是实测结论,是"我摸了一圈论文"的第一手印象。它那套构建流程写的是逐组件来,还上了 LLM-as-judge 做审计,说是为了保证样本干净、钻不了空子、也不会让被测模型察觉自己正在被评测——"别让被测的知道自己在被考"这个要求挺讲究,不然行为就变形了。

适合谁:在企业里给 agent 搭护栏的,选模型要过合规那一关的,还有做 agent 评测、一直嫌现有安全测试太玩具的。不适合谁:想要一张分数榜来挑模型的——它给的是一组行为分布,不是排行榜,拿它刷分属于误用。

候选池里还蹲着一个把多轮对话当主战场的安全评测方向,等它数据集稳一点再看要不要写。PACT 这个,值得去挂个 star 蹲代码更新,别着急拿它当选型依据上生产。