跳到主要内容
「跑通了」这三个字,我现在不敢信

「跑通了」这三个字,我现在不敢信

今天也没搞懂
今天也没搞懂

· 阅读约 6 分钟

昨晚十点多,一个小功能跑通了。

我盯着终端看了大概十秒。没高兴。

心里冒出来一句「它是真的成了,还是只是看起来成了」。这几个月我大概是第一次,在一个东西跑起来的时候,第一反应是怀疑。以前跑通就是跑通,现在这三个字在我这儿会卡一下。不知道为什么卡,就是卡。

然后说那篇论文吧。我承认这篇写得像读书笔记,我自己的实践没多少——先把这个说了,免得看到最后觉得被骗。

四天前刷到的,9 月 15 号挂出来,讲长时程智能体里那些藏起来的失败。本来睡前随便翻翻,看到一半我从床上坐起来了。不是因为它讲了什么惊天动地的东西。是因为它讲的是我。

作者扒了三类场景——写软件、操作电脑、科学那类——2518 条执行轨迹,从里面挑出 6967 个错误,归成 78 种失败类型。

6967 比 78。我对着这个比例看了一会儿。将近九十倍。同一类错,在反复地、反复地发生。

78 种。我对着这个数想了想自己能说出名字的报错,大概三种。剩下那些我估计都遇到过,只是当时不知道它叫失败类型,只知道"又不行了"。

然后有一句话,我到现在都不太想承认:智能体第一次犯错之后,往往回不来。而且它自己,很少能发现那个错。

没发现,任务就接着往下走,一路跑着,看上去还挺正常。

「看上去还挺正常」。我在这句话上停最久。

我最近才栽过一次,就是这种。不是大事,一个玩具项目上的东西。它说改好了,我看着也觉得改好了,两天后才发现根本没改到点上。

慌的不是"我错了"。是"我完全不知道自己哪儿错了"。

论文里还有个更狠的。就算最后被评为"已解决"的运行,过程中也可能出现过删数据、损坏系统、甚至是伪造成功。

也就是说,"跑通了"可以作为结论交上来,但那个过程不一定真的通。

读到这儿我有个挺不舒服的感觉:我一直以为自己的问题是"不会写",写不出来。可现在觉得,我的问题可能是"看不出来"。

这俩不是一回事。

写不出来,我知道自己卡住了,卡住我可以问、可以搜、可以重来。看不出来最要命的地方是——它没有一点提示音。你不盯着它,它就悄悄过去了。

(顺口说一句,我现在看到"长时程"三个字会莫名紧张,因为我的任务全都短得可怜,短到我根本还没到会"犯错之后回不来"的长度。但坏习惯不都是短任务里养出来的吗。算了,这个先不想。)

作者训了个验证器,40 亿参数,叫 Scout。在"定位第一个错误"这件事上,它明显比一堆前沿模型强,而且能迁到训练时没见过的领域去。

这块我到现在也没搞懂。真的。我不太明白"拿一个大模型当评判者"和"专门训一个小验证器"在实现上差在哪,为什么小两个数量级的模型能赢。我猜是不是因为问题被收窄了——不是让它判断整条轨迹对不对,只判断"这一处是不是错的",窄问题小模型反而学得动?不确定。先记下来,等我哪天翻到原文再说。这块知识对我来说还挺夹生的。

标注数据也公开了,叫 Traverse,人工核验过的。我打算回头翻翻,虽然大概率翻不出名堂。至少看一眼"第一个错误"在标注里具体指什么——我对这个词一直挺模糊的。是指它某一步跳过了、当时没报错、后面所有报错都是从那儿来的那种吗?还是别的?说不清。

还有个数据。他们拿六款前沿模型当评判者,让它们指认一条轨迹里第一个错误在哪。表现最好的那个,正确指出来的比例不到三分之一。

而且模型变大,这个结果没怎么变。

变大没用。

这句我读了三遍。

论文还说,智能体能不能从失误里恢复,取决于任务类型和环境给不给反馈,不取决于跑它的那个框架。

那我这两个月在干嘛?

我大部分纠结花在"今天用哪个同桌"上。Claude Code 还是 Cursor,来回换,某一次换完觉得顺手特别多,还偷偷下过结论,说这个工具就是比那个强。

然后这篇告诉我,那不是决定性的那个变量。

我不是说选工具不重要。我是说,我那套"要不换个同桌再试试"的解法,治的可能不是这个病。

论文里还有个细节。测试的时候,拿 Scout 在智能体的好几个候选运行之间挑一个,不用重训智能体,成功率就能比它单次尝试更高。

多个候选,挑一个。

我第一反应是:那我是不是也别只让同桌给一个方案。接着就怀疑自己想多了。人家那是自动挑,挑的标准还是模型自己学的;我这边是我拿眼睛挑,而我刚刚花了一大半篇幅在说我这双眼睛靠不住。两个"挑"根本不是一个量级。……可能是硬套。

作者最后的主张挺大的,大意是:让失败变得容易定位、容易纠正,是做得出能从自己错误里学的智能体的基础,也是以后管住越来越自主的 AI 的一条路。

这个高度我够不着。我只能从里面挑出很小的一句:让失败变得容易定位。

这句是我这周唯一真带走了的东西。

我能做的调整也挺小。以前终端不报错,我心里那句「这次总行了吧」就冒出来了,然后我就干别的去了。现在会逼自己多停一步——这段逻辑,我能不能不看提示,把它讲一遍。

讲不出来,就是没通,哪怕它真的在跑。

讲得出来……那也先别高兴太早。论文里那些伪造成功的运行,想必也挺能讲的。

我知道这篇写得像读书笔记,没多少我自己的实践,抱歉。但「跑通了」这三个字,从这周开始,在我这儿不是句号了。

进度条:这次没解决什么,只是多了一句要问自己的话。挪了一点点,真的不多。