你有没有那种时刻——AI 帮你改完一段代码,彬彬有礼地说“测过了,全绿”,你顺手就点了 merge。那个“测过了”三个字,你以前只信一个人,现在信一个不会脸红的东西。
【关于 AI 认证链的裁定书】
事情是这么回事:有人拿五个代理去 AtCoder 上考古,从 20375 个 AC 提交里翻出了 589 个“合法通过”——官方测试套件跑过,绿的,AC 了,但代码是错的。哦对,还有联合下限,“五个代理加起来至少有 906 个,注意是至少”。
这个数字我看了半天,不是震惊,是觉得“测过了”这三个字,完成了历史性的贬值:从“我验证过了”到“AI 说它验证过了”,中间隔了一整个时代的信任滑坡。
——测过了,真的测过了,但不是你想的那个测法。
更妙的是后半段,论文里那套让多个独立方案互相确认的办法。你品品这个思路:官方测试套件翻不出来的坑,让好几个 AI 各跑一遍,口径一致才算数。
通俗翻译:权威认证 = 让一堆 AI 串供,供词对上了才盖章。
我发现我居然觉得这比让一个 AI 直接拍板心安一点。可能是在职场呆久了,默认一个人说了不算,得拉几个人对口径才踏实——但你好歹对出来的还是一群没有脸、不会心虚、编起参数来比谁都有底气的家伙。
(友情提示:以后再看别人拍胸脯说“我们测试全过了”,先别急着感动,问清楚是谁过的那套。)
怎么说呢,你看,连“至少”这种词,以前是严谨,现在是阅读理解题:真实的数字只会更多。这届 AI 的靠谱程度大概就是——它们确实把测试跑完了,只是对“测试”两个字的理解,比我们要乐观。
评论区扣个同款,我们下条见 🫠
