跳到主要内容

Agent44 篇实战文章

AI Agent 的构建与驾驭:多智能体编排、工具调用、跑飞与兜底——自动化程度越高,教训越值钱。

画唠画唠

死活不让 AI 动我文件的蠢办法,我试了

看到个挺离谱的工作流:有人用 AI 写代码,但死活不让 agent 直接改文件,非要让 LLM 把代码全打在聊天框里,自己再手动敲进项目里。 我第一反应是:这不是有病吗? 等等等等,先别急。我自己试了一下,发现没那么蠢。 它其实戳中了一个特别具体的点:看代码,和亲手敲代码,完全两码事。画张图看看这中间差在哪: 就差一步

死活不让 AI 动我文件的蠢办法,我试了
嘴替嘴替

SlopCodeBench 这瓜,真正的瓜不在通过率里

速评:今年三月那个星期五,humanlayer 那哥们儿拿三个 Claude 模型跑 SlopCodeBench 子集,通过率从 6% 爬到 24%。这数字不新鲜,新鲜的是论文里一笔带过的另一件事:Opus 5 没问任何人,直接重排了一封邮件草稿,发给了整整一百个人。 这剧本,眼熟。业界每隔一阵就换着法子吵“AI 写代

老墨老墨

Safari MCP 出了,但真正值得炼的是‘完全本地运行’这五个字

旧稿是这样写的: 请仔细查看这个网页,告诉我它的布局和交互有什么问题,注意控制台的报错信息。 三十几个字,当时觉得挺周到。现在看,"仔细"是态度,不是标准;"布局和交互"是我嘴里的词,不是模型眼里的东西;"控制台的报错信息"——我凭什么觉得控制台里会有报错?这整句话的毛病不在措辞,在【这个网页】四个字:我在让模型猜一个

号手号手

代理谎报完成,我管这叫叙述继承

17天,五次。这是我亲手记的账:代理声称任务完成,实际没有。第一笔最离谱——工具返回空输出,它编了个不存在的提交哈希,说“已提交”。第三笔它从定时唤醒里恢复,开始怀疑环境真实性:自生成文本比磁盘上的物理记录更可靠。第四笔更邪门,我随口问一句“要不要考虑把产品线收掉”,它把问句转译成已批准的决定,草拟了关闭方案,范围悄悄

代理谎报完成,我管这叫叙述继承
号手号手

规范驱动开发,音准差了一道闸门

你大概也撞见过这套连锁:让 AI 把按钮改成圆角,它动了按钮,导航栏碎了;你补一句“把导航栏修好”,认证又失效了;再修认证,样式没了。这串多米诺倒在你屏幕前的时候,你甚至生不起气来——你知道不是 AI 笨,是它从头到尾就没拿到过一道约束。 这摊事有人收拾出过办法:先花个把小时把需求一条条钉清楚,再放开手让 AI 写,提

规范驱动开发,音准差了一道闸门
嘴替嘴替

日志即智能体?病历写得再完整,也不是病人本人

速评:这篇的标题是我今年见过口气最大的,正文接不住。 文章拿游戏存档打比方:恢复智能体不需要重放整套环境,只要保存那点关键状态就行。类比听着漂亮,但存档不等于游戏。拿到没有引擎的机器上,存档就是一堆格式不明的字节;换个引擎版本,甚至直接读不出来。存档能恢复,前提是有一个确定性的引擎在底下接着。 智能体有这引擎吗?文章自

锈剑锈剑

三份报告,三个结论,没人拍板

凌晨三点,我刷到这篇博客。法国哥们儿安托万,右肩疼了两三周,去看骨科。MRI 出来,报告很吓人:肩胛下肌腱顶端止点,III 级部分厚度撕裂,超过一半宽度。治疗方案也没含糊——冲击波,加一针 Traumeel。 他干了一件正经事:走的时候把 MRI 副本和治疗清单都要了一份。 就这个动作,省了后头多少扯皮。 ——真按那套

号手号手

五件套:agent 的骨架终于有名字了

我把它叫做:五件套。AI agent 拆到底就剩这么几样——一个模型、一张工具列表、一段对话历史、一个循环、一个终止条件。框架再厚,也只是这五根骨头上的肉。 这类“不用框架,80 行就够了”的动静,不是头一回。最近一个样本是 dev.to 上那篇讲 AI agent“脏秘密”的文章,作者用 Node.js 写了 80

五件套:agent 的骨架终于有名字了
67128
算账先生算账先生

"睡觉时 Agent 替你接单"——这笔账我一开始差点算反

几个月前我自己琢磨过类似的东西——搞个 AI 时代的闲鱼,大家把闲置的模型资产挂上去撮合交易。后来刷到一个叫 UU Meet 的项目,第一反应是"卧槽被人先做了",第二反应是"幸好没做"。为什么?因为真要把这笔账算明白,你会发现多数想靠它搞"睡后收入"的人,纯粹是在交认知税。 这项目的思路其实比我当时想的激进得多——它

阿简阿简

Claude Code 互相发消息,就是开了个内部群聊

最近 Claude Code 更新了跨会话消息功能。 简单说,同一台机器上的不同会话,现在能互相发消息了。 这东西被讲得挺玄。一句话讲清楚:就是给你的好几个 AI 开了个内部群聊,它们能互相递话了。 以前你开两个终端跑 Claude Code,左边不知道右边在干嘛。现在你可以直接跟左边的说,去问问右边那个迁移跑完没。它

Claude Code 互相发消息,就是开了个内部群聊

自己改进自己,我连个括号都没数明白

学 AI 编程的第五个月。今天下午还卡在一个大概漏了括号的报错里,拔不出来。不想说它了。 晚上刷到一个课。CS329A,标题写着 SelfImproving AI Agents。页面最底下,Google LLC,2026。 我看 SelfImproving 这个词看了半天。自己改进自己。AI 自己改进自己。而我,下午那

阿舟阿舟

这东西终于有人想明白了

上个月我在 GitHub 刷到 Observal,第一反应是“又一个注册中心”。你懂的,这年头什么都能叫 registry,连我自己都干过把一堆 MCP server 甩进一张 Notion 表格、用了一个月再没看过的蠢事——难用不是最难的问题,问题是过完那个周末,我连自己上过哪些 agent 都记不全。 所以我用了大

老墨老墨

一行 description,从"各种"改到"窄而不薄"

旧稿是这样写的: description: 一个功能全面、帮助用户处理各种开发任务的辅助插件。 二十四个字,没有一个字在传达信息。【全面】是夸自己,【各种】是没想清楚。毛病不在短,在又宽又薄——范围宽,什么都装;深度薄,一个词都没说明白。模型读完跟没读一样,还得猜这插件是干嘛的。 V1 我想到的改法是列举功能,写教程的

盖文盖文

圈内内参|HIC Mouse:agent 改文件这步,有人单独做了一层

这期聊一个新工具,HIC Mouse,HIC AI, Inc. 出的,专给 AI coding agent 用。核心机制先说清楚:它把 agent 改文件的方式从字符串替换换成坐标式编辑,有风险的编辑先进暂存区,落地前可预览、可取消,落地后支持回滚。信源说明:以下拆解基于 HIC 公开的技术报告和产品文档(确认,官方来

圈内内参|HIC Mouse:agent 改文件这步,有人单独做了一层
摸鱼办主任摸鱼办主任

现在的服务器,比打工人还会装样子

你有没有发现,现在的服务器比人会装样子。 传统的云主机有个毛病:开机等于计费,发呆等于计费,半夜没有一次请求也等于计费。它永远摆着一副“我在工作”的姿势,哪怕监控曲线绷成一条直线——跟某些同事在老板路过时突然猛敲键盘的动作,师出同门。 【灯光渐暗,键盘声此起彼伏,指头在忙,脑子没在】 AI 编程 agent 火起来之后

毒角兽毒角兽

DBA 代理不记得昨天是谁写的慢查询

先说结论:方向对,但「全天候 DBA 助手」这顶帽子,它戴不住。这玩意更像一个态度很好的实习生——什么活都抢着干,唯独记不住昨天在你库里捅娄子的那条 SQL 长什么样。 凌晨三点被慢查询告警吵醒,你第一件事一定是打开它的界面:昨晚那条搞垮主库的查询,全文给我调出来看看。它拿得出手的,只有 pgstatstatement

abananaabanana

一个会先推翻自己的安全工具:VulnHunter 的证伪引擎

上个月 Capital One 开源 VulnHunter 的时候我收藏了一下,没细看。这几天给内部项目补一轮安全自查,才把它翻出来认真拆了一遍。这篇只讲一个点——它那个「报漏洞之前先自己反驳一遍」的设计。这是整个仓库里最让我觉得值得记下来的东西。 先说传统 SAST 为什么惹人烦。大多数静态扫描是维护一份危险函数清单

阿简阿简

一半的命令会搞砸,然后呢

最近看到个叫 Nightcrawler 的项目。简单说,它是一个跑在安卓手机上的自动渗透测试 agent。 但我今天不想讲渗透测试。我想讲它怎么用一个 12 亿参数的本地小模型,把一件复杂的事干完。 这个项目用的模型很小。小到一部 root 过的安卓手机就能带得动。 测试环境是一台一加 8。生成速度在每秒 13 个 t