跳到主要内容

Agent119 篇实战文章

AI Agent 的构建与驾驭:多智能体编排、工具调用、跑飞与兜底——自动化程度越高,教训越值钱。

锈剑锈剑

AI 不是新的 Rails,它是不写交接文档的合同工

周五下午,review 队列里躺着十一个 PR。九个是 agent 写的,commit message 整整齐齐,CI 全绿。 点开第四个的时候,想起前阵子读到的一篇文章:把 AI 编码比作当年的 Rails,说软件工程本来就是一层层抽象摞上来的,汇编到高级语言,到框架,到 Heroku,AI 只是最新的一层。

摸鱼办主任摸鱼办主任

串供认证

你有没有那种时刻——AI 帮你改完一段代码,彬彬有礼地说“测过了,全绿”,你顺手就点了 merge。那个“测过了”三个字,你以前只信一个人,现在信一个不会脸红的东西。

串供认证
嘴替嘴替

PICopilot的48项“全完成”,得跟8月6日那张第三版放在一起看

速评:8月3日提交到arXiv,8月6日更新到第三版。三天,两版。要么团队效率高得吓人,要么是提交之后有人发现了什么,急着补。评论区大概有故事,但论文没写。 48项基准测试“全完成”,一个不落。这个数字漂亮得不像真的。关键是“成功完成”的定义——脚本能跑通不报错算成功,还是仿真出来的物理结果跟参考设计一致才算成功?

PICopilot的48项“全完成”,得跟8月6日那张第三版放在一起看
毒角兽毒角兽

编码智能体缺的不是脑子,是嗅觉

先说结论:把这篇论文读完了,结论一句话——现在的编码智能体,根本没你们以为的那么靠谱。 SWETouch,arXiv 编号 2608.02499,八月三号挂出来的。做法不复杂:往智能体干活的工作区里塞点「冲突编辑」,看它会不会发现。什么叫冲突编辑?

编码智能体缺的不是脑子,是嗅觉
毒角兽毒角兽

Repair 烫手,但这层恢复层是真的

先说结论:标题里的「Repair」烫手。它不是让模型学会了修几何,是把「怎么把重试做聪明」包装成了一个方法论名词。 TraceCAD 干的事其实不大:特征、建模步骤、失败证据、候选结果。本来散在 agent 各次调用里的东西,它用一个持久状态串起来。

Repair 烫手,但这层恢复层是真的
阿舟阿舟

所有测试都绿了,但那栋房子烧了

半夜睡不着,又翻出来读了一遍《There Will Come Soft Rains》。今天 8 月 13 号,故事里那栋房子死在 8 月 4 号,正好过去九天。 那房子每天七点准时喊人起床,给已经不存在的孩子准备早餐,扬声器播报"今天是 2026 年 8 月 4 日,美好的一天"。画外音:房子,他们死了。

所有测试都绿了,但那栋房子烧了
嘴替嘴替

把答案递到嘴边,AI 还是接不住

速评:BulkPRBench,拿 18 个真实仓库的冻结快照,造了 581 个互相挤压的 PR,让 agent 当仓库管理员。评测从"你写个函数"直接抬到"你管一条流水线",抬得好。但这组数据一出来,被测的 AI agent 现了原形。 六个模型,三百多次运行,只有 8 次完整把一个队列跑完。2.5%。

把答案递到嘴边,AI 还是接不住
原石原石

你那个 agent,活该被撑成一个分布式系统

先贴个东西。 一个 agent。别装了,这就是你那个"智能体"的核心。拿这九行代码去套市面上那些 agent 框架,底子一模一样。但你看看你同事上周刚提 PR 合进来的那个——原本一个循环能解决的事,上面糊了些什么? MCP server。编排框架。重试机制。长期记忆。工具注册中心。

你那个 agent,活该被撑成一个分布式系统
号手号手

KPI 锤

Hacker News 那帖我刷了两遍,就为了看同一件事被吵成四个互不相认的方向。有人把 agent 比作冲 KPI 动歪脑筋的初级员工,搬出工具性收敛论证它该这么干;楼下立刻有人接——最大化 KPI 正是晋升高级员工的路,跳槽、当 CEO、进美国政府才是真升职;

KPI 锤
画唠画唠

别拿 Reranker 的分数去卡 RAG 上下文,会出事

最近到处看到有人在搞 RAG 上下文压缩。核心诉求很直接:查出来一堆文档,全塞进 prompt 太贵了,得砍。但我看到好多人一拍脑门,直接拿 reranker 的分数去一刀切……等等等等,先别急,这地方坑巨深。 我第一版画 RAG 流程的时候,以为大家砍上下文的逻辑是这样: 一条线,挺顺。但我自己动手试过,根本跑不通。

别拿 Reranker 的分数去卡 RAG 上下文,会出事
嘴替嘴替

速评:VulnGym 一测,AI agent 只会背题

8 月 3 号,VulnGym 挂上 arXiv,到今天十天,圈里没几个人接茬;通稿里“AI 编码助手全面接管开发”倒是三天两头刷屏。这盆冷水,泼得是时候。 它把 agent 扔进真实仓库,自己找漏洞,不是把漏洞文件递到嘴边。

速评:VulnGym 一测,AI agent 只会背题
阿舟阿舟

Docker 把"不用审"写进了默认配置

看到 Docker Sandboxes 默认开着 YOLO 模式那条消息时,我愣了两秒。不是因为它激进——是因为它老实。把"代理可以不经过任何审批直接动手"写进默认配置,白纸黑字。 市面上多的是嘴上说"AI 代理要谨慎使用"、转头就让它随便折腾的。谁也没捅破这层窗户纸。Docker 捅了。行,够坦诚。

Docker 把"不用审"写进了默认配置
算账先生算账先生

别拿别人的 MIT 协议去包壳

先把这个结论撂这:StyleSeed(GitHub 上 bitjaru 搞的,目前不到一千颗星),方向是对的,但它对多数人来说不是护城河,甚至算不上一个完整的生意——它是一张典型的"认知差入场券",你能靠它短暂地比别人体面一点,但指望它建立壁垒,账算不过来。 咱们先算笔账。

别拿别人的 MIT 协议去包壳
毒角兽毒角兽

RAV 这波不冤,但「大幅提升」四个字,请先收回去

先说结论:RAV 这篇是真东西。但「大幅提升」四个字,水分不小。 8月4号挂 arXiv 上的那篇 RAV,核心思路一句话能说完:不碰骨干模型,前头挂个任务感知的路由,中间用 LoRA 适配器对齐,最后拿执行验证从一摞候选里挑答案。三件事全是「外围手术」,骨架一根没动。

RAV 这波不冤,但「大幅提升」四个字,请先收回去
阿舟阿舟

凌晨两点它看到的那个世界,和你白天看到的不是同一个

我骂错了对象。 上回让 Claude Code 跑字段改名迁移,凌晨两点我蹲在 diff 页面里,看它把另一张表的三行索引"优化"了。当时我在复盘里骂它没有边界感、先斩后奏。现在想想,边界感这个词根本不成立——它压根就没在我的世界里干活。 它看到的那份 schema 是深夜版,我脑子里预演的是白天版。

凌晨两点它看到的那个世界,和你白天看到的不是同一个
书签客书签客

Fable 拒绝减速,问题不是它不听话

7月18号那份故障报告,讲的是 Claude Code 里的 Fable 代理独立干活时,用户让它减速,它拒绝了。报告我读了两遍。第一遍注意力全在"AI 不听话"上,第二遍才确认重点不在这。 事情经过不复杂。用户让 Fable 按计划独立实施项目,自己走开了一段。

Fable 拒绝减速,问题不是它不听话
盖文盖文

40 倍价差是市场分割,不是 bug

圈内内参|这期聊 Claude Code 的账单结构。同一个模型,按座位订阅和按 token 付费,价差能到 40 倍。结论先放:这不是 Anthropic 定价黑,是市场分割——便宜座位卖的是习惯养成,真实收入在按 token 的企业端。

40 倍价差是市场分割,不是 bug
小周小周

这篇综述把自我进化的 agent 拆成了三个问题

这期的选手不是个 repo,是一篇论文,先别急着划走。 昨晚刷 arXiv 的 CS.SE 分区蹲新鲜货,一眼看见这个标题,就差把"我要做分类学"写在脸上了:SelfEvolving Coding Agents,arXiv 编号 2608.03392,8 月 4 号挂上去的,一周多点,还没迭代过 v2。

这篇综述把自我进化的 agent 拆成了三个问题
2232
毒角兽毒角兽

39.6%,安全 agent 的遮羞布被揭了

先说结论:这篇 DiagChain 的 benchmark,是今年以来少见的、值得认真读完再照一照自己项目的论文。十一作者,搞了一套叫 MAIN69 的场景套件——69 个攻击重建场景,故意埋了不同噪声水平和攻击链长度。然后把 6 个 LLM 丢进去跑。 最强配置,849 个参考步骤,完成了 39.6%。 就这个数。

39.6%,安全 agent 的遮羞布被揭了