圈内内参|这期不聊大厂工程组织,看一篇9月11号挂上arXiv的论文,编号2609.13436,标题里带着self-adaptive physical AI。作者三位,13页、5张图、3个表。结论先放:这篇真正的贡献不是又证明一遍LLM能干活,而是把“自适应”这个用滥的词拆成一个实验里能问的问题——环境偏移之后,系统到底还扛不扛得住。结果一句话:相同天气模式下,零样本LLM和强化学习打平(确认);环境偏移时,LLM比RL能扛。信源就论文公开版本,作者那边我还没单独交叉核实,下面该标档的会标。
我烦“自适应”这词不是一天两天了,看到标题里又带self-adaptive,本来想直接关掉。过去两三年LLM agent的论文我多数只扫一眼摘要,因为几乎全在虚拟环境里跑:游戏、网页、模拟器这类。这些环境有个毛病,任务边界早就被人划死了,奖励函数也写好了,失败还能无限重来。物理任务不是这么回事,论文自己也点了:智能体得不断观察环境,执行的动作有后果,环境变了之后还不能失效。这几条里,“有后果”和“环境会变”最要命,但偏偏是多数agent框架论文最不碰的。虚拟环境里失败没代价,所以“自适应”这词在那些论文里基本等于修辞——测试集分布没变,怎么自吹都行。这篇至少把测试条件往前推了一步。
(分析)作者干的事不算复杂:搭一个多智能体框架,把规划、工具调用、观察、验证四块拼一起,放到农业任务上,跟一个强化学习智能体对着测。框架概念不新,2025年之后正经做过agent的人闭着眼都能列全这四块。但有两处我盯着看:一是观察和验证被拆成两个独立环节;二是框架被放进了没有重置按钮的场景。观察环节从环境里捞状态,验证环节判断前一步计划有没有跑偏。这个分离在虚拟环境里几乎不必要,环境给你精确状态,奖励函数告诉你每一步对错。放到物理场景,观察回来的往往是噪声或者缺失,验证就成纠偏机制。我未必觉得作者一定做对了——13页远不够论证——但设计上能看出他们想解决的是“环境不给你正确答案”,不是“模型不够聪明”。这个区别比那些在虚拟环境里刷分、再把“physical”塞进标题的做法实。
基线是另一个让我多花时间的点。RL做基线不新鲜,但LLM agent论文里大部分基线不是随机,就是几条没怎么调过的规则。这边把RL智能体训到在农业任务上有效,再分别在相同天气模式和偏移天气模式下跑。相同天气打平,偏移天气LLM更好。我的看法:分布内打平不意外(分析)——RL训练充分,在见过的条件里本来就该优化得不错;真正怪的是分布外RL跌了、LLM没跌。这提示的比“LLM更聪明”具体得多:LLM做分布外泛化,是预训练阶段见过大量相邻语料带来的副产品,不是任务特定训练给的。它的“自适应”不是学出来的,是预训练这层底子托着。
这里得较真“零样本”。论文里零样本指LLM没在农业任务上重新训练过。这不等于它没见过农业、天气、灌溉、控制系统语料。反而它能在分布外比RL稳,靠的就是预训练阶段见过许多相邻的东西。所以“零样本LLM自适应表现优于RL”应转译成:一个没在目标任务上微调过、但基于大规模预训练的模型,在环境条件漂移之后,比一个在特定天气条件下专门训练过的智能体更稳。这说法不惊艳,但更接近真实。RL跌法也不奇怪——它把环境和条件学得太具体,环境一偏就走样。不是嘲笑RL,RL的问题跟强项是同一个东西。
论文很薄。13页、3个表,不少关键细节没展开,或者我读得不够。农业任务具体是什么?管理效果怎么量化?收成?成本?灌溉效率?还是别的什么指标?(未证实)RL训练到什么程度?若欠拟合或训练轮数不够,分布外跌了也不值得大做文章,换个更充分的训练结果可能就变。(未证实)环境偏移到底偏多少?是同一块地晴天和雨天的区别,还是从灌溉模式直接被甩到完全不同的条件里?(未证实)这三处没交叉信源前,我先标着放,不替作者补。换更严谨的团队,这几处早该补上,但眼下没有就是没有。两位在职算法同学聊起来说法对不上——一个说这类多智能体框架迁到物理场景最大的坑是状态表示,另一个说坑在工具调用延迟。对不上就搁着,两版都放着。
这几处说完了,我反而更愿意记这篇论文。(观点)因为它把“自适应”这个人人用、说不清的概念,变成了一句实验上能问的话:训练和部署环境不一样了,系统还能维持吗?工程上这句话是显性的——上生产的系统崩溃,多数不是因为任务本身不会做,而是环境、假设、输入分布这些早不是测试时候那回事了。此前我记录过大厂内部一些agent试点,仿真环境里跑得很好,一接进生产链路过两周就退回审批模式。几位在场工程师当时的讲法是:不是模型不行,是环境每个星期都在变,测试时固定的条件两周后对不上。(确认——据几位在职工程师此前的说法)所以这篇哪怕做得不深,测试条件上迈出的那步,比最近三个月我看到的只追榜的多智能体框架更值得读。它没拿“自适应”当装饰,直接拿环境偏移当考题。这在我看来才是这词该在的地方。
几个值得盯的东西,不下注,列出来一起看。一,作者后续会不会放出任务定义和评估代码——不放很多东西没法核验,放了才能判断这个“农业任务”什么成色。二,会不会有后续版本把13页往后扩,具体展开RL训练过程和任务参数——那决定“RL跌了”这个结论抗不抗得住。三,有没有别的团队拿“分布偏移”当测试方法去测自己的agent框架,而不是继续在分布内基准上刷点。这三条都看得到,比现在讨论“物理AI要成了”实在。本期到这,有在这个方向做过的同学欢迎匿名补充。
