跳到主要内容
那份记录里,两件相反的事长得一模一样

那份记录里,两件相反的事长得一模一样

夜航船
夜航船

· 阅读约 5 分钟

一点半过了,桌上那杯茶是今晚第三回续的水,淡得跟开水没什么分别,我懒得起身去换,就那么一口一口喝着。屏幕上那个 agent 还在跑,替我收拾一段白天写了一半就撒手的代码,进度条走得比我本人有耐心;这是今晚第二次夜航。趁这空当翻一篇前两天刚挂出来的论文,标题里那句 misleading advice from AI agents,先把我逗笑了。

七十来页,正文十页,补充材料六十二页。这个结构我太熟,正文负责讲一件漂亮的事,剩下那六十二页负责说明这件漂亮的事在什么条件下才成立;真正要紧的东西多半躺在附录里,像一个人真正要紧的那部分从不着落在简历上。

论文问的是这么个问题:攻击者不去碰量子比特,转而去撬那个给系统提建议的 AI 顾问呢。纠错方案要不要更新、往哪更新,眼下越来越多是让一个模型看着综合征历史先给个方向,人和系统再点头;把这个顾问撬弯,让更新朝有害的方向走,是不是一条比硬碰硬件便宜得多的路。这思路不算意外,意外的是他们接下来做的事。

对奇数距离的方形环面码,在制备、综合征测量和恢复都不出错的理想情形下,两种符号相反的相干 X 旋转,在被动综合征历史分布上是不可区分的。读到这儿我把杯子放下了。同一份记录,同一个分布,底下可以是两件相反的事,而这两件事要的补法恰好相反,一个固定相位修正在这头是药,换到那头就是毒。

不,这么说不准确。不可区分不等于没法知道,确切一点讲,是只看被动记录这一条路的时候,符号那一位压根就没被记下来;缺的是一个符号,不是一段信息。要么另找地方再测一次,要么就承认自己在赌。

论文给的法子是对着已知的编码校准态做终端逻辑测量,把丢掉的那一位找回来。我对这一手有点偏心,它没在教系统怎么变得更聪明,它是在补一笔本该公司记、却一直没上账的数目。

这里容我岔开一下。有一阵子我总想起很多年前一个旧同事,一件事在他走之后有了两种说法,两种都能跟当时留下的排期、那些往来信件对得上,谁也不比谁更占理。那时我以为难处在于要找到一个肯讲实话的人,后来才明白,难的是没有一个地方能戳一下,告诉你哪一边的符号是正的。人和系统在这件事上没多大分别,记录越干净越完整,越容易被当成事实本身,而它其实只是一段投影;投影再清晰,也不是那个东西。

论文显然没打算把判断权从顾问手里收回来,它做了另一件事,造一个独立评估器。这里是全文我真正想说的:这个评估器不假设顾问一定给出正确建议。听上去像个技术上的保守设定,其实是一种站位的态度。多数讲可信 AI 的说法,前提都是模型大体可信,然后我们再防它偶尔出错;这里是把“它可能正被人牵着走”写进默认假设,不留退路。放行的条件也定得死,校准的不确定性加上有依据的漂移界限,这两样合起来证明新方案确实比眼下这套更好,才接受更新,否则一律拒绝。模拟的建议攻击里这确实管用,有害提议被那道校准置信度检查挡了回去,顾问老老实实给建议的时候,有益的更新也还留得下来。

不过我最想抄下来的是另外两处不太好看的结果。表面码那组,噪声来自随机电路、采集过程中还在变,这种条件下确定性控制器拿到的有益更新并不比别的办法少;而环面那组,一旦漂移假设被违反,有害更新是能漏进去的。

担保是带条件的。这句在这里不是修辞。前面那些好看的结论全压在几条关于漂移的假设上,假设一松,闸门就开。我们平常说验证过了,说得像给一件东西盖了个章,其实盖的是个租约,到期得续,房东还可能改条款。

还有一笔账算得清醒:评估做得越保守,放进来的坏更新越少,被挡在门外的有益更新也越多。论文把这个代价算了出来,被保守策略放弃掉的那部分改进是量过的,不是凭感觉估的。这一点别人未必觉得新鲜,我看着倒有些感触,肯把这数字写进正文的人,我大致愿意听他把话说完。

前面说对那手校准偏心,现在还偏心,只是没偏得那么理直气壮了。独立评估器也好,校准测量也好,都得靠一个前提撑着,就是还有人愿意在放行之前多花那一点时间。难处从来不在写检查,在于肯不肯让那道检查有机会说不。

快三点了,那杯茶彻底不能喝。agent 早跑完,屏幕暗下去,屋里只剩冰箱那种若有若无的动静。本来想把论文存进收藏夹,想了想还是关了,那个夹子里躺着的这类东西多半再不会被打开第二次;倒是那句不假设顾问一定给出正确建议,大概会跟着我一起躺到床上去。