Kiro Crew 那篇,最值得读的不是 6 个定时任务,是前两周的校准期
这篇讲的是怎么用 Kiro Crew 上 6 个 cron 定时任务替代每周大约 4 小时的重复 DevOps 工作。出处是 dev.to 的 Sarvar Nadaf,8 月 7 号发的,Kiro Crew 系列第 3 篇。 我先说为什么差点跳过。

这篇讲的是怎么用 Kiro Crew 上 6 个 cron 定时任务替代每周大约 4 小时的重复 DevOps 工作。出处是 dev.to 的 Sarvar Nadaf,8 月 7 号发的,Kiro Crew 系列第 3 篇。 我先说为什么差点跳过。

圈内内参|这期不聊大厂工程组织,看一篇9月11号挂上arXiv的论文,编号2609.13436,标题里带着selfadaptive physical AI。作者三位,13页、5张图、3个表。

这篇论文我第一眼看完,脑子里就一句话:它没解决“实验室失传”,它只是把“实验室失传”算成了一笔账。别把它当解药——解药是吃了能好,账本是让你看见病在哪、值多少钱。往下算。论文里那套东西,把“复现”的账算得很漂亮:你让它去跑一篇已发表论文的图,它能跑出来,还跑得比商业通用智能体好。但这叫复现,不叫继承。

这条讲的是 Kiro Crew 安全模型怎么过 CISO 那关的,作者 Sarvar Nadaf,发在 dev.to 的 AWS Community Builders 板块。我收藏夹里放了将近三周没点,标题太像产品宣传稿——《I Showed My CISO Kiro Crew》。

这条在讲一个我憋了很久的问题:agent 跑长任务失败之后,根因到底怎么找。出处是 arXiv 2609.13463,原作者 Harsh Raj 他们一帮人,2026 年 9 月 11 号挂上去的,主分类 cs.AI,交叉到 HC、LG、SE。

不是谁的真实配置。是把"行为模型"这一层从这类架构里单独抽出来之后,大概长成的样子。最后那行备注——无需重新读取页面结构——就是这篇要讲的东西。 9 月 11 日挂上 arXiv 的那篇,arXiv:2609.13491,cs.AI,Alexandru Ianta 和 Eleni Stroulia,OdoBot。

九月十二号挂上 arXiv 的 PAIBench,到今天满打满算十天。按我给自己定的规矩,十天前的东西通常不够格单独成篇,单帧画不出曲线,等它跟另外两三帧接得上再写也不迟。这次破例,理由是这个东西不算一条新闻,算一套协议;协议不会在十天里挥发,而且我手里已经有另外两帧能跟它接上。

速评:这篇论文最该转的不是结论,是它自己招了在哪塌。 9月15号挂 arXiv 的 cs.AI 分类,9月16号出第二版,隔一天。14页正文配1张图。这个配置本身就有信息量——那些判断不是图跑出来的,是人一条条读答案读出来的。一天之内改了啥我没比对,不猜,可能是作者信息也可能是补表,不知道的事不编。
上周五晚上,小玩具项目跑到一半断了。上下文满了,还是我手滑按了 esc,记不清。反正断的位置很尴尬——配置文件刚被它改了一半。 我重开一个会话,跟同桌说:接着刚才的改,把导出那块加完。 它接着了。顺畅,一路没报错。 今天下午我去读那段代码,才发现它接的是一个夹生的中间状态。

上周有人在群里甩了个 arXiv 链接,2609.13771,Homeostatic Continual Learning,9 月 12 号挂上去的。18 页,12 张图,1 张表。图比一般论文密,看得出来作者是真想把机制画清楚。 我点开它的时候,正在改自己那个 agent 的记忆层,改得一肚子火。

上周 arXiv 上挂了篇东西,cs.CR 底下,编号 2609.14003。标题长得像流水线出来的,《Confuse the Model, Control the Flow》。点开它不是因为关心隐私,是同事转过来时说了句"这不就是你老念叨的那个事"。看完我认了。 它讲的是个人 AI 代理。
前几天晚上我又在调一个跑 agent 编程的部署。单纯想让它单用户响应快一点,就把 batch size 从 16 压到 4。烧起来,单流测试里 token 间隔从 170ms 降到 90ms 出头,看着确实快了。可同一张卡,一小时能喂饱的并发请求从两百多个掉到四十几个。

9 月 13 号挂上 arXiv 的 TriCalRAG,编号 2609.14762。标题里那个"基准"我没兴趣,戳我的是中间一段结果描述: zeroshot 下,两个开放权重模型基本退化,某些数据集上,把 100% 的事件都判成 anomaly。 一条不漏地报警,等于一条都没报。

$N 是从一张 1999 年的证书里读出来的模数,t 32 是线程数。剩下的事交给机器自己跑。 有人真这么干了。Matthew McPherrin 把 Netscape 4.51 里那两张 512 位的根证书拆了,SSL 那张 32 小时,S/MIME 那张 29 小时,用的是他自己的 Ryzen 9 5950X。
上周四下午三点,我第六次打开 amount 那个文件,组长从隔壁工位探过头来问我装了没。我说没。他说你装吧,我求你了。 老项目的这个字段,数据库里存的是分,前端要显示成元。没有统一的 format 函数,全散在四十来个文件里,写法一个赛一个地不同,有的 toFixed 有的没有,有的中间还插了一道汇率。
9 月 13 号,凌晨一点多,我在 arXiv 上刷到一篇新东西。标题很直白——Not All Agents Are Equal,五个商业编码 agent 的代码质量和合并后维护。37,623 个 PR,2,807 个仓库。9 页,5 张图 2 张表。 我没读正文,直接翻到有数的那一页。

群里天天有人吹某某新模型,什么榜单第一、上下文多少多少万。要我说,榜单这东西跟业务跑不跑得动是两码事,当年我们看 TPC 排名也是这么看的,跑分第一,上了生产照样趴窝。所以一开始我没换,旧的用了小半年,顺手了,干嘛折腾。 后来是被逼的。 上个月月底,对账跑批出事。
清障之后又出现新阻塞。ProRail的通报里写得很具体:荷兰中部和北部轨道上被放置管道和线缆,相关事件超过35起;有些点在清障之后,新的中断又冒出来。这不是一次集中破坏,而是一个能反复补充的持续状态。攻击者用极低边际成本把铁路调度反复按停,防守方每一次清障,只是把一个已经被证明可以重复出现的动作再执行一遍。

别急着修模型,语义坍缩的问题在你身上 先把结论撂这:这篇论文如果只被当成“AI 会越用越蠢”的又一份证据,那等于白看。真正有意思的不是语义坍缩又出现了,而是它为什么没有发生在所有人身上。三万个活跃智能体,几周时间,同一套生态环境,有的输出越来越像,有的居然还能保持高新颖性——差别不在模型,在使用者对待这些智能体的方式。
九月十三号晚上刷到这篇,arXiv:2609.14592,Kantarcioglu 的 vision paper,之前在亚特兰大那场 ACM AI Summit 26 上讲过一轮。标题里有个词:Accountable。 我第一反应不是"这方向不错",是——这不就是值班表上那点破事,终于有人给它起了个正经名字。