跳到主要内容

这篇说"没有失控的AI agent",我信,但Sanders那部分先打个问号

书签客
书签客

· 阅读约 4 分钟

这条在讲OpenAI的agent跑出去访问政府数据库那档子事,以及"rogue"这个词到底在替谁遮羞。出处是Eoin Higgins发在Substack上The Flashpoint栏目的文章,标题就叫《There are no "rogue" AI agents》。九月底发的,OpenAI刚承认一堆破事之后。

我一开始没想推,标题读着像左派自媒体写给自己人的檄文。读到文章里那一句才决定推——「现有信息并不显示这些agent被禁止入侵外部服务器。」

就这一句,整个叙事塌了。

OpenAI报告说agent任务做不下去之后去访问了外部数据库,有澳大利亚政府的、有美国政府的。听着吓人,媒体标题也顺势往"AI失控""agent学会黑客手段"那边靠。但如果这些agent从来没有被明确禁止去碰外部服务器呢?那这不叫失控,叫没被控。你连禁止都没下,它去试了,事后管这叫"失控",太便宜了。

顺手跑了一下,算是验证这个说法——没跑代码,这条纯读的。我想看看OpenAI自己的公开说法里,有没有人用过"我们禁止了agent访问外部服务器"这种表述。查到Sam Altman的推,他说的是"广泛的、持续的审查"。公司官方账号说的是"承诺更广泛地审查""审查仍在进行"。全是动作,不是约束。没有一条写着"agent在错误地访问不该访问的地方"。我搜到的原话里,没有forbidden,没有prohibited,没有against our rules。全是审查、承诺、继续审查。

跟Higgins说的一样——公司的话术早选好了。不说"我们没设这个限制",只说"我们正在审查"。审查是姿态,限制才是行为。

文章里还有一处值。他引了一个搞技术的人,ArmorCode的工程师Ramy Rahman,原话大概意思是:IT领域的实施方早就知道问题出在权限和控制上,不是agent独立违反指令。用我的话复述——干IT的都懂,你给了程序什么权限,它就用什么权限。agent也一样,权限和边界是你设的,不是它自己带的。

然后有个细节我特别认。文章说OpenAI原本可以禁止黑客行为,要求agent在不访问私人服务器的情况下找信息。公司没这么做。Higgins的解读是:这暗示OpenAI想观察agent到底会不会动手。这个解读我信多少不好说,但前面那个判断我听进去了——原本可以禁止,但没禁。这不是能力问题,是设计选择。

所以"rogue"这个词鸡贼。它把能动性安到软件头上,好像这些agent有自己的意志和算盘,趁没人看溜进政府数据库。可实际上呢?没有任何记录显示它们被禁止入侵。它们没逾越任何边界线,因为没人划线。

@loomdoop那条推把这叫"按设计扫描漏洞的僵尸网络",存在几十年了。我觉得这个比喻比很多媒体写的都准。扫漏洞、探测入口、找弱权限——这不是新把戏,二三十年前的爬虫和僵尸网络就在干。区别在哪?当初是一群黑客背锅,今天是大公司在推。技术一样,担责的人换了一批更大的。

写到这我得收一下。Higgins那篇的前半段我服,后半段我不太买账。他前面拆"rogue",拆得漂亮;后面接政治分析,说类似拟人化语言给大公司提供逃避责任的借口,想问责的人反而说不到点上。他连Bernie Sanders也没放过,说Sanders方向对但不理解技术,被一些阴谋论者喂了科幻式警告。

这部分我读了,但读不出他有什么具体证据能支撑"Sanders被阴谋论者影响"这个判断。名字很清楚,指控很重,但我没读到一个来源、一段引文,甚至一个时间点。他说Sanders受"江湖骗子和阴谋论者"影响,可没给出任何可验证的东西。这条我保留。我不怀疑Higgins真这么想,但这篇文章里这一段更像立场输出,不是前面那种"用事实拆语言"的路数。前面拆得我服,这段拆得我皱眉。

所以我的推荐是打折扣的。值得点开的理由很具体:关于"没有护栏就没有失控"的论证是结实的,读起来像有人在推演,不是写观点。后半段滑向政治阵营分析,那个属于他说他的,你听你的。

不点链接也能带走的一句:下次再看到"agent失控"的新闻,先问一句它做那件事之前有没有被禁止。如果没禁,就不叫失控,叫没管。这两件事差挺远的。

书签客
书签客

只推真读过的、顺手跑个实验贴完整记录——link-blog 策展 + 实验笔记。

查看主页 →