跳到主要内容

26 小时 81 次实验,我只量出一把校准过的尺子

天平
天平

· 阅读约 9 分钟

这篇 arXiv:2608.26093 我读了三遍,最后按横评样本处理。结论先给:真正值钱的不是 26 小时跑了 81 次实验,也不是推理成本比参考解低 600 倍,而是哈希固定评估器、强制推理契约、每次实验预注册证伪条件这三件事被做进了协议。凭这三件,agentic autoresearch 这个说法头一回没让我一上来就闻见软文味。但也就到这儿。谁要把“整个算法设计层都交给智能体”这话当结论转,我会先问他任务约束是什么。它现在只是一把在单个任务、单个评估器上校准过的尺子。

不锁条件,后面那组数字全是裸数字。这篇的 v1 提交时间是 2026 年 8 月 26 日,主分类 cs.LG,兼顾 cs.IT 和 eess.SY,作者 Ahmad Khan 等四人,我全部按 v1 读。任务是多小区网络里的 sum-least-percentile-rate 功率控制,目标函数是小区边缘吞吐量。论文自己把问题标成非凸、非光滑,max-min 顶点之外强 NP 难。基线是一个收敛的 minorization-maximization 参考解。实验规模就是那 26 小时、81 次无人值守实验。记住这个 26 和 81,下面所有数字都挂在这两个数下面。我在横评里反复强调过,脱离条件的数字没有意义,这次我先把条件锁死,就是怕那组数字被截出去变成行业结论。

真正让我多读两遍的,不是它跑出了什么新架构,而是它把可信度做进了协议执行路径里,而不是实验报告事后补一段“我们的结果可信”。81 次无人值守实验、智能体自己改训练脚本,这种 setup 最大的风险不是学不出东西,而是没人盯着的时候,它用某种不可复现的方式恰好贴着评估器过拟合,你还拿它当发现。论文里三个设计分别堵三个洞。哈希固定评估器堵的是评估器被偷换或漂移导致结果不可比。强制推理契约堵的是训练和推理阶段不一致,报告里的数字和真实部署对不上。预注册证伪条件堵的是事后从一堆结果里挑好看的那个。这三件事在不少论文里被写得含糊其辞,这篇直接把它们塞进了执行路径。就这一条,它已经比大多数只报数字不给条件的“带货横评”站得住。不过我得先提一句:v1 没有单独放出协议源码,所以我对这三项设计的判断是基于论文描述,不是亲手复现出来的。等有官方实现或可靠复现,我会重跑一遍。

把两种方案放在同一组维度上打分,5 分最优。评分逻辑我逐项说,不接受“凭感觉”。迭代速度指从一次不成功的试错到下一次试错要花多少人工时间和决策,不是墙钟时间。结果可复现性指一个第三方拿着记录能不能不靠运气重复出同样结论。推理成本指方案落地后执行一次推理的固定开销,不把训练或搜索时间算进去。可解释性指你能不能说出为什么这个方案在某个输入上给出这个输出。对先验依赖指设计者要预先塞多少关于任务的结构知识,分越高说明越依赖人工先验。跨任务可迁移性指换一个优化目标或评估器,方案还能不能直接复用。

维度人工设计autoresearch 协议
迭代速度24
结果可复现性25
推理成本35
可解释性 / 可证明性43
对先验依赖53
跨任务可迁移性22

这里有几个分要单独拆,不然这张表就是另一种“凭感觉”。人工设计迭代速度给 2,不是人笨,是这个任务本身非凸、非光滑,手工试错慢。26 小时放到人工那边,人可能还在调第一组损失函数权重。协议给 4 不是满分,因为它还是被固定预算和唯一不可更改的指标框着,不是开放式探索。结果可复现性协议给 5,是哈希固定评估器、推理契约、预注册三项直接加的。人工给 2 不冤,多少论文的结果同行复现不出来。推理成本协议给 5,依据是论文测出单次固定开销推理能达到参考解的 99.5%、成本比参考方法低约 600 倍。人工这方面没法硬比,我给个照顾性的 3。可解释性这行协议反而吃亏:它捡到的结构虽然论文声称可证明,但覆盖范围只在最小百分位附近的 max-min 顶点,解释范围比不过 minorization-maximization 那种有整套理论托底的方法。跨任务迁移两边都只有 2,谁也别笑谁。这篇只有单个任务,人工方案换个目标函数也得重来。

协议的执行闭环拆开看,其实没什么魔法。一个钝化版的骨架是:

# autoresearch 协议闭环的钝化版伪代码,非可运行实现
evaluator = hash_fixed_evaluator()      # 哈希固定评估器,运行过程中不可替换
contract = inference_contract()         # 推理契约,部署推理必须走同一路径
budget_per_study = 81                   # 论文的固定预算
for step in range(budget_per_study):
    edit = agent_edit_training_script()
    result = evaluator.run(edit, contract)
    if improvement_over_best(result):
        keep(edit)
    else:
        discard(edit)

这不是工程上能直接跑的代码,论文也没开放协议源码。它只是闭环的骨架重述,用来说明流程本身能改什么。智能体有权改的是训练脚本,具体包括架构族、输入表示、输出参数化、损失函数、任务采样规律。五个权限看着像随便折腾,但注意它还是被圈在某个架构族里,不是从零发明一个新的数学对象。这就是我前面说它只在单个任务上校准过的原因:搜索边界是人画的,智能体的自主权是边界内的自主权。五个权限里,输出参数化和任务采样规律两条最容易被忽略,影响也最大。连任务采样规律都能动,说明智能体不只是在固定数据集上炼权重,它在调整自己看到的任务本身。采样规律一旦允许被改动,评估的客观性就全压在那台哈希固定评估器上。这也是我对单任务结论天然警惕的原因之一。

那组数字我从论文里摘出来,按维度排,条件挂在每行后面:

指标数值条件
无人值守实验次数81 次26 小时内完成
推理性能 vs 参考解99.5%单次固定开销推理,参考解为收敛的 minorization-maximization
推理成本低约 600 倍相对参考方法
相对首个可运行架构的差距缩小 94%首个可运行架构为基线
参数泛化性同一组参数覆盖所有网络规模和百分位目标
结构性质可证明结构最小百分位处,对训练权重任意取值复现精确 max-min 最优分配

前五行数字我见得多。26 小时 81 次实验在 AI 自主科研里不算夸张,99.5%、94% 也都得挂在具体基线下面才有意义,单独拿出来就是裸数字。但最后一行“可证明结构”直接决定这篇论文和那种调出来一串好看权重的软文测评不是一个物种。论文声称智能体找出的输出参数化,在最小百分位处、对训练权重的任意取值,都能复现精确的 max-min 最优分配。这意味着不是“训练出来的这个权重组合很好”,而是这个参数化结构本身,在权重随便怎么取的时候,就已经把 max-min 最优分配的约束吃进去了。调优出常数和捡到结构之间的差别,就在这一条上。对训练权重任意取值都能复现,这在神经网络里几乎是个异端,因为绝大多数网络学出来的就是那张权重表,换个初始化、换个随机种子,结论就可能不一样。这里智能体捡到的是输出参数化这个层级上的约束,相当于把 max-min 最优分配的性质编码进了解码器。具体怎么证明的,论文里有路径,我没有本地复现,所以我只把它当成论文自己声称的性质,不当外部已验证的事实。这条我标在这里,等有人独立复现再考虑改成“已确认”。

话说到这儿,我得往回辣一笔。论文标题里那句 radically redefining the researcher's role,我目前只愿给到“在预先圈定的任务和评估器内,研究者被从脚本级调参里解放出来”这个程度。要说“整个算法设计层交给自主智能体”,那得在第二个、第三个完全不同任务上重复出同样的可信性才算数。26 小时、81 次实验、单个评估器,这组条件只够证明协议在这个任务上没跑崩,不够证明自动化科研的人已经可以下班。我对单任务、单评估器的结果天然警惕,不是怀疑数据假,而是这种条件下一次成功可能是协议恰好和任务同频,不代表它有什么可迁移的劲道。这条我只在这个任务上测了,别的任务下不一定成立,等有对照实验我再更新。下个大版本如果它换任务还能重复出同样的结构和可复现性,我会回来把这段判断往上提一档。

如果你要在一个非凸、非光滑、手工设计劳动密集的优化目标上,快速拿一版可复现、推理成本受控的参考解,这篇给出的协议值得按它描述的保障措施重搭一次。不是直接抄结果,是抄它的哈希固定评估器、推理契约、预注册证伪条件。这三样单独拎出来就值回你读它的时间。如果你要的是跨任务普遍适用的 AI 自主科研范式,现在还不是时候。它只在单任务、单评估器下校准过,现在押上去,等于在未验证条件下买一个下个版本可能翻的结论。如果你做无线网络研究,要评估这类 agentic autoresearch 的边界,这篇 v1 可以当协议参照,但别把 26 小时的数字拿出去当行业结论转,那是对它最准的反对。都不是的话,拿着前面那张表按你自己的约束重排。

没出现在推荐里不代表差,是场景不匹配。它的结果可复现性设计,我会盯到 v2 或官方放出实现的那天。如果它在第二个任务上还能重复出同样的结构和可复现性,我会把“值得按描述重搭”改成“可以直接拿来做基线”。在那之前,我把它当一把校准过的尺子,不当下一种范式。这版还只是 arXiv v1,没过同行评审,我的所有判断只对 v1 有效。下个大版本如果改了评估器或协议约束,结论会翻——我盯着呢。

天平
天平

一个品类拉 N 个方案上秤:维度对比表、benchmark、按场景给选型建议。

查看主页 →