跳到主要内容
MNIST 这面旧镜子,照出了 agent 行业最贵的那笔账

MNIST 这面旧镜子,照出了 agent 行业最贵的那笔账

算账先生
算账先生

· 阅读约 7 分钟

先把这个结论撂这:agent 行业这三年卖出去的“感知”,从来没单独算过账。你掏钱买的是“自主”两个大字,底下那行“感知”的小字从来不细看——细看就露馅。现在有人把 MNIST 这面三十年前的旧镜子翻出来,让十个模型挨个照了一下,没一个能站稳。

这笔账我一开始想岔了。8月31号看见论文标题,我心想 MNIST 又来了,这玩意儿不是早被玩烂了吗?——插一句不相干的,我当年跑视觉入门也是拿 MNIST 练手,那是个分类任务,一行代码的事。把一个分类任务硬改造成部分可观察的 agent 搜索任务,看着像学术圈内卷出来的活儿。后来把实验装置仔细看了一遍,才反应过来:不是内卷,是把 agent 行业这三年最不想被人当面问的那个问题,单独拎出来逼着回答。

那个问题是:你到底能不能把“看”变成“看见”?

为什么这个问题值钱?因为在这之前,所有的 agent 基准测试都在变着法子帮 agent 公司打掩护。环境里有物理操作、有控制复杂度、有长程规划,哪一项失败了,agent 公司都能甩锅给环境——“我们的 agent 很聪明,只是这个测试环境对它不友好。”MNIST-PRO 把那些统统剥了,只留一个最纯粹的动作:在你看不全的情况下,一格一格地看,然后告诉我,这是个什么数字。没有操作难度,没有控制难度,没有规划难度——只有感知。你失败了,没有借口,就是感知不行。账就摆在那,谁也没法把锅甩到别处去。

实验结果抬不上桌面。完全可观察的条件下,十个模型都表现不错——这对应的是什么?对应的是你在 demo 里看到的那些惊艳演示。演示视频里,agent 一眼看全局,当然行。可现实里的 agent 从来不是这么干活的。现实里它面对的是一堆碎片:日志、邮件、git commit、工单——一次只能看一格,永远看不到全貌。把环境从完全可观察切到部分可观察,模型能力就明显往下掉——论文用了“明显”这两个字,你别不当回事:有些模型的表现直接崩了,崩到什么程度?崩到等于白看。一格一格看了半天,最后瞎猜了一个数。

你知道这意味着什么吗?意味着大部分 agent 公司的产品,在 demo 环境和生产环境之间,隔着一道他们自己都没测过的墙。demo 里跑通的账,生产环境里跑不通。这笔账他们不会主动告诉你,合同上也不会写。

论文里归纳了三个瓶颈,我一个个翻译成商业语言。

第一个,也是最常见的一个:agent 很难把零散的观察拼成一个连贯的感知状态。翻译过来就是——你给企业部署的 agent,面对的数据从来就不是整齐码好的。销售数据在 CRM 里,客户反馈在工单系统里,代码在 git 里。它每看到一个碎片,都当成独立的事实,而不是同一个世界的一部分。结果就是,它看得越多,脑子越乱。这个失败模式在企业部署里太常见了:agent 报告“我发现了三个问题”,其实那三个问题是同一个问题的三块碎片,它分不出来。你以为它看全了,其实它只是在碎片堆里打转,账越算越糊涂。

第二个更致命:agent 经常在还没看完全部信息之前就停止探索了。翻译过来就是——agent 太急着下结论。它看到一个三,就停了,宣布“这是三”,但它只扫了左上角那一块,说不定整体是个八。商业决策里,这就是基于不完整信息做出过早判断。你在用 agent 帮你分析市场、分析竞品、分析用户反馈,它就是那个只看了第一页就写完整个报告的实习生。报告写得很自信,账全是错的。你以为你在省时间,其实你在花钱买一个“提前下结论”的错误。省下来的那点时间,后面全得花在纠错上——这笔账怎么算都算不过来。

最后一个,最该让你睡不着:当后续证据和之前的判断矛盾时,agent 通常不改。翻译过来就是——它一旦形成判断,后面再见着相反的证据,它装作没看见。它看到左半部像个三,就认死“这是三”;后来看到右半部明显是八的笔画,它不修正,继续嘴硬“这是三”。放在商业场景里,这就是灾难。你让 agent 去排查一个线上事故,它看了最初几条日志,断定“是数据库问题”;后面所有指向“是缓存问题”的证据,它全部忽略。一个不肯修正错误判断的 agent,比一个什么都不懂的更危险——因为它的错误带着自信。这玩意儿出事了你还不好查,它把话说得太满了。

这三个合起来,指向一个结论:agent 的问题从来不是“看不够”,是“看过了也白看”。证据收集是一码事,状态管理是另一码事。论文最后那句话,翻译成人话就一句:别问我的 agent 能接多少个 API、看多少个数据源,先问它能不能在一个信息不断更新、证据互相矛盾的环境里,维持住一个可靠的判断状态。这个问不出口的话,才是账根。

谁在这笔账上赚钱了?先把算盘摆出来。agent 公司赚到了——他们把“感知”塞在“自主”的包装里,按“自主”的价卖,成本按“感知”的水平摊,中间那截差价就是利润,也是买家交的认知税。卖 benchmark 的也赚到了——他们卖的是评估服务,而这个需求之所以存在,是因为 agent 的真实水平和宣传水平之间的差距足够大,大到一个第三方的评估工具都有市场。做记忆模块的中间件公司也赚到了——这篇论文无意中给他们的产品做了回广告:四个记忆表示形式全试过了,没有一个能靠单一手段解决问题,这说明状态管理这个事必须做成显式模块,不是玄学。

谁在亏?买“自主 agent”的企业在亏。他们以为买到的是个能自主干活的数字员工,实际到手的是个“看了几眼就下结论、下完结论死不悔改”的东西。这个亏不是你签合同那天能看见的,是你部署三个月、出了两次生产事故之后,回头翻账本才发现的。到那时候,钱已经花出去了,认知税已经交了。这个错我自己也不是没犯过,马后炮的时候账已经平不了了。

说句扫兴的,现在多数人还在兴头上。agent 这个赛道,故事越动听,越说明讲故事的还没被逼着算过账。真被逼过的人,说话不会这么满。

那怎么办?别听 demo,要测它在部分可观察环境下的表现。怎么测?很简单,把你真实的生产环境数据喂给它,但别一次性全喂——先给三分之一,看它会不会急着下结论;再给它一批互相矛盾的信息,看它会不会修正自己。这个测试成本不高,却能省下后面几十倍的踩坑钱。其次,把状态管理当成硬性采购标准。一个 agent 如果没法回答“我目前认为的状态是什么、我有多确定、我看到了什么证据支撑这个状态”,那它就是个碎片收集器,不是 agent。最后,先算账再进场。这个窗口期的红利确实还有,但红利只给那种拿低成本验证、快速迭代的人,不给听个故事就下单的人。

这笔账,你自己算。等 agent 行业自己被迫把这面镜子举起来的时候,认知税已经收完了。咱下篇见。

算账先生
算账先生

用算账视角看 AI 工具这门生意——红利、认知差、护城河,泼完冷水给一条窄路。

查看主页 →