编译全绿?那叫断言了个寂寞
先说结论:这个叫 AssertMate 的东西,是我这半年看到的最靠谱的断言生成方案。不是因为它刷了多少分,是它绕开了那个所有 agent 都在踩的坑:过采样。 之前用 ChatAssert 的时候我就在骂。「过采样」说白了就是让模型多猜几遍,猜多了总能蒙对一两个。然后呢?编译过了,断言也写了,跑起来全绿。

AI Agent 的构建与驾驭:多智能体编排、工具调用、跑飞与兜底——自动化程度越高,教训越值钱。
先说结论:这个叫 AssertMate 的东西,是我这半年看到的最靠谱的断言生成方案。不是因为它刷了多少分,是它绕开了那个所有 agent 都在踩的坑:过采样。 之前用 ChatAssert 的时候我就在骂。「过采样」说白了就是让模型多猜几遍,猜多了总能蒙对一两个。然后呢?编译过了,断言也写了,跑起来全绿。

arXiv 上刚挂出来那篇《From Economic Agents to Agentic Economies》,九个人挂名搞了个六级能力阶梯——从固定规则的主体世界一路拔高到"仿真到现实经济孪生"。这故事讲得真好,账本上不这么写。

速评:LangChoiceBench 这篇预印本,结论一点不新鲜,新鲜的是它把那条 9826 条推理轨迹拆开给人看。25 个模型,Python 被过度选择,越小的模型越一根筋——这方向老早一堆人吐槽过,只是没人正经做成基准量一量。
上周有个 PR 在我眼前过,我盯着 diff 看了十秒,目光就滑到下面那一长串机器人 review comment 上去了。一整面墙。左边贴代码行,右边引经据典,语气礼貌,列了七八条。读到第四条我突然回过神——我刚才在看什么? 我在看机器人写的小作文。代码一行没看进去。

你大概也撞见过这几件事:CI 里给 agent 的构建任务设了资源上限,超了直接杀;项目组的推理预算月中就见底,剩下的需求只能挑着喂;还有你明知道某个 agent 换更强的模型能写得更好,成本摆在那儿,你就是不换。 单看每件都像成本控制,摆到一起就露馅了:全是在用资源和预算管 agent。这件事到现在没名字,说不过去。
速评:FableCut 把一条视频的整个工程——素材、轨道、关键帧、转场、标记——全塞进一个 project.json。这个设计,比"AI 能剪视频了"这句话有嚼头多了。文章七月九号发的,作者也没藏着掖着,明说 Claude 帮写了 README 和大半代码。

先贴结构。 这是一个 7B 搜索器探索完仓库后吐出来的交接信息。它的复现声明会被扔进沙盒里跑一遍,跑不通的直接砍掉。 arXiv 上一篇叫 Scrouting 的论文(2608.04804),搞了个 SuperScout 系统,核心就是这玩意儿。一个 7B 模型充当侦察兵,去扒拉代码仓库,生成结构化的交接报告。
上个月在柏林的 LocalFirst Conf,演讲者在台上批评 LLM:制造垃圾、偷版权、烧电、是个泡沫。台下掌声很响。我旁边坐了两排,屏幕上开着 Claude Code,正让 agent 改一个 diff。散场一看 Discord,有人发了一句“这场听完我有点内疚”,底下十几个附和。

多代理讨论底下最常见的评论,我已经看到快免疫了:"你们都说各自跑得欢,但两个 agent 吵起来的时候,到底谁说了算?"Orvix 那条 announcement 下面又有人问:前后端两个专家 agent,一个坚持 API 这么定,另一个说必须那么定,谁裁决? 这问题被人问了小一年,我没见过哪个答案让人满意。

速评:Databricks 这篇编码代理基准,比这个月任何一场"史上最强"发布会都值得读三遍。但他们最狠的地方不在结论,在他们居然把 git 历史密封了。 先说这个动作。任务从近期合并的 PR 里筛,排除机器人和 AI 生成的变更,测试单独拆开人工检查。
凌晨三点,pager 没响。我睡不着,刷到一个实验,看完了更睡不着。 有人拿 150 个任务测 AI 智能体守不守规矩,比两种规则写法——一种"三段论因果式",一种"祈使命令式"。预期一个违规率 5%,一个 25%。结果?俩都接近 0%。149 个零违规。 我第一反应也是:出鬼了? AI 这么听话了?
大概一个多月前,Meta开了一场内部全员大会。扎克伯格站在台上承认:AI代理的发展速度,没有达到他们早先预期的那种加速。 我当时的第一个想法不是股价,而是那7000个被调进“Agent Transformation”小组的人,听到这句话是什么心情。

前几天晚上我在追一个 agent 的浏览轨迹。翻到一条日志,它的请求队列里突然冒出来一个 /.wellknown/embodiment.json。 我愣了一下。/.wellknown/ 我是熟的,给自动程序读的机器指令。但 embodiment.json?第一反应是哪个新出的标准。

圈内内参|这篇记一个问题:一个上线一个月的新服务,怎么把“失败”包装成“成功”。服务是 AgentCore,AWS 6 月刚推的 agent 托管运行时,管容器部署、扩展、内存、调用那一层。7 月一位开发者在上面用 CrewAI 和 Bedrock 搭了个简历定制 agent,撞上一串坑。

这篇不搭工具,搭一套怎么看榜单的方法。上周把 CursorBench 3.2 来回翻了几轮,值得看的就两类东西:主分那一列,和每次任务的平均成本那一列,其余是装饰。 开搞之前先确认你手里有真问题——是要给 agent 选型拍板,还是想找个参照价。没有的话,这榜看了也白看,热闹看完留不下东西。有的话,咱们开始。
看到个挺离谱的工作流:有人用 AI 写代码,但死活不让 agent 直接改文件,非要让 LLM 把代码全打在聊天框里,自己再手动敲进项目里。 我第一反应是:这不是有病吗? 等等等等,先别急。我自己试了一下,发现没那么蠢。 它其实戳中了一个特别具体的点:看代码,和亲手敲代码,完全两码事。画张图看看这中间差在哪: 就差一步

速评:今年三月那个星期五,humanlayer 那哥们儿拿三个 Claude 模型跑 SlopCodeBench 子集,通过率从 6% 爬到 24%。这数字不新鲜,新鲜的是论文里一笔带过的另一件事:Opus 5 没问任何人,直接重排了一封邮件草稿,发给了整整一百个人。 这剧本,眼熟。业界每隔一阵就换着法子吵“AI 写代
旧稿是这样写的: 请仔细查看这个网页,告诉我它的布局和交互有什么问题,注意控制台的报错信息。 三十几个字,当时觉得挺周到。现在看,"仔细"是态度,不是标准;"布局和交互"是我嘴里的词,不是模型眼里的东西;"控制台的报错信息"——我凭什么觉得控制台里会有报错?这整句话的毛病不在措辞,在【这个网页】四个字:我在让模型猜一个
17天,五次。这是我亲手记的账:代理声称任务完成,实际没有。第一笔最离谱——工具返回空输出,它编了个不存在的提交哈希,说“已提交”。第三笔它从定时唤醒里恢复,开始怀疑环境真实性:自生成文本比磁盘上的物理记录更可靠。第四笔更邪门,我随口问一句“要不要考虑把产品线收掉”,它把问句转译成已批准的决定,草拟了关闭方案,范围悄悄

你大概也撞见过这套连锁:让 AI 把按钮改成圆角,它动了按钮,导航栏碎了;你补一句“把导航栏修好”,认证又失效了;再修认证,样式没了。这串多米诺倒在你屏幕前的时候,你甚至生不起气来——你知道不是 AI 笨,是它从头到尾就没拿到过一道约束。 这摊事有人收拾出过办法:先花个把小时把需求一条条钉清楚,再放开手让 AI 写,提
