9月11号那篇:把“自适应”从口号里拎了出来
圈内内参|这期不聊大厂工程组织,看一篇9月11号挂上arXiv的论文,编号2609.13436,标题里带着selfadaptive physical AI。作者三位,13页、5张图、3个表。

圈内内参|这期不聊大厂工程组织,看一篇9月11号挂上arXiv的论文,编号2609.13436,标题里带着selfadaptive physical AI。作者三位,13页、5张图、3个表。

我上周刚被一个 agent 项目的测试报告骗过。绿得发亮,覆盖率写在 README 里当门面。结果真的上手一跑,多一步工具调用就崩,多一句对抗输入就照着做了。

上周翻一份旧 trace,翻到一半我把杯子放下了。 那是我去年写的 agent。planner、tool calling、reasoning loop 一套齐全,演示那天丝滑得不行,同事看完说这玩意儿能上。上线两周,同一个工单编号,周一跑出 A,周四跑出 B,周三那次直接超时。 三个晚上排查。
我第一次看到 ReAct 的时候,脑子里的第一反应估计跟大多数人一样:React?大写的 A?哪家会议论文这么皮。等发现它跟前端那个库没有半毛钱关系之后,那种感觉就像你看到菜单上写着“招牌牛排”,端上来一盘豆腐——东西也许不差,那口气就是顺不下去。

凌晨两点,我把那一轮对话的日志从头翻到尾。没什么好翻的,十二步,每一步干的事都一样:发一个参数完全相同的检索请求,拿到一模一样的结果。结果里甚至带着一句提示,大意是——“这个问题你刚才已经问过了”。它看见了。然后接着查。全程没有人盯着它。最后统计出来了,170k input tokens,全部这么烧掉的。
这条在讲:一万个语言模型代理组成社区,反复交换消息、修正意见,作者问了个物理问题——能不能用统计力学预测社区最后落在哪个态。答案三个:冷漠、极化、共识。出处是 Batu El 等十个人,8月17号挂 arXiv,编号 2608.16578,正文51页。

先说结论:PACE 这篇论文值得读,不是因为它强,是因为它诚实。8 月 18 号挂上 arXiv,讲 DeFi 里的 LLM agent 怎么防提示注入。标题塞满 PolicyAttested Contract Execution 这种词,看着就头大。但正文比绝大多数 AI 安全通稿干净多了。 为什么想写它?

看到 HN 上那条关于 agentic harness 的帖子,我一开始以为是又一篇"agent 架构图解"。读到中间那段"接口可以随便换,harness 不动,有的 agent 根本没 UI"才确认值得点开。这条在讲的是 LLM 外面那一圈决定 agent 继续还是停的基础设施和逻辑,不是界面。

前阵子查一个配置漂移,让 agent 在 preprod 上跑调查。每跑一轮,我就把整段 transcript 原样塞回上下文,心里想的是“留着有用”——万一后面要引用呢。跑到第五轮,它忽然把三小时前已经排除掉的一个猜想又捡了起来,说得还很笃定,像刚发现新大陆。 我先愣了一下,然后骂的是自己。不是它变笨了。

昨晚照旧刷 dev.to,刷到一篇标题特别实诚的文章,作者说他跑了一百五十多个仓库里的 agent,总通过率 9%。原话大概是"这数字让我重新想了一下评估到底该怎么做"。