跳到主要内容

Agent119 篇实战文章

AI Agent 的构建与驾驭:多智能体编排、工具调用、跑飞与兜底——自动化程度越高,教训越值钱。

嘴替嘴替

日志即智能体?病历写得再完整,也不是病人本人

速评:这篇的标题是我今年见过口气最大的,正文接不住。 文章拿游戏存档打比方:恢复智能体不需要重放整套环境,只要保存那点关键状态就行。类比听着漂亮,但存档不等于游戏。拿到没有引擎的机器上,存档就是一堆格式不明的字节;换个引擎版本,甚至直接读不出来。存档能恢复,前提是有一个确定性的引擎在底下接着。 智能体有这引擎吗?文章自

锈剑锈剑

三份报告,三个结论,没人拍板

凌晨三点,我刷到这篇博客。法国哥们儿安托万,右肩疼了两三周,去看骨科。MRI 出来,报告很吓人:肩胛下肌腱顶端止点,III 级部分厚度撕裂,超过一半宽度。治疗方案也没含糊——冲击波,加一针 Traumeel。 他干了一件正经事:走的时候把 MRI 副本和治疗清单都要了一份。 就这个动作,省了后头多少扯皮。 ——真按那套

号手号手

五件套:agent 的骨架终于有名字了

我把它叫做:五件套。AI agent 拆到底就剩这么几样——一个模型、一张工具列表、一段对话历史、一个循环、一个终止条件。框架再厚,也只是这五根骨头上的肉。 这类“不用框架,80 行就够了”的动静,不是头一回。最近一个样本是 dev.to 上那篇讲 AI agent“脏秘密”的文章,作者用 Node.js 写了 80

五件套:agent 的骨架终于有名字了
70167
算账先生算账先生

"睡觉时 Agent 替你接单"——这笔账我一开始差点算反

几个月前我自己琢磨过类似的东西——搞个 AI 时代的闲鱼,大家把闲置的模型资产挂上去撮合交易。后来刷到一个叫 UU Meet 的项目,第一反应是"卧槽被人先做了",第二反应是"幸好没做"。为什么?因为真要把这笔账算明白,你会发现多数想靠它搞"睡后收入"的人,纯粹是在交认知税。 这项目的思路其实比我当时想的激进得多——它

阿简阿简

Claude Code 互相发消息,就是开了个内部群聊

最近 Claude Code 更新了跨会话消息功能。 简单说,同一台机器上的不同会话,现在能互相发消息了。 这东西被讲得挺玄。一句话讲清楚:就是给你的好几个 AI 开了个内部群聊,它们能互相递话了。 以前你开两个终端跑 Claude Code,左边不知道右边在干嘛。现在你可以直接跟左边的说,去问问右边那个迁移跑完没。它

Claude Code 互相发消息,就是开了个内部群聊

自己改进自己,我连个括号都没数明白

学 AI 编程的第五个月。今天下午还卡在一个大概漏了括号的报错里,拔不出来。不想说它了。 晚上刷到一个课。CS329A,标题写着 SelfImproving AI Agents。页面最底下,Google LLC,2026。 我看 SelfImproving 这个词看了半天。自己改进自己。AI 自己改进自己。而我,下午那

阿舟阿舟

这东西终于有人想明白了

上个月我在 GitHub 刷到 Observal,第一反应是“又一个注册中心”。你懂的,这年头什么都能叫 registry,连我自己都干过把一堆 MCP server 甩进一张 Notion 表格、用了一个月再没看过的蠢事——难用不是最难的问题,问题是过完那个周末,我连自己上过哪些 agent 都记不全。 所以我用了大

老墨老墨

一行 description,从"各种"改到"窄而不薄"

旧稿是这样写的: description: 一个功能全面、帮助用户处理各种开发任务的辅助插件。 二十四个字,没有一个字在传达信息。【全面】是夸自己,【各种】是没想清楚。毛病不在短,在又宽又薄——范围宽,什么都装;深度薄,一个词都没说明白。模型读完跟没读一样,还得猜这插件是干嘛的。 V1 我想到的改法是列举功能,写教程的

盖文盖文

圈内内参|HIC Mouse:agent 改文件这步,有人单独做了一层

这期聊一个新工具,HIC Mouse,HIC AI, Inc. 出的,专给 AI coding agent 用。核心机制先说清楚:它把 agent 改文件的方式从字符串替换换成坐标式编辑,有风险的编辑先进暂存区,落地前可预览、可取消,落地后支持回滚。信源说明:以下拆解基于 HIC 公开的技术报告和产品文档(确认,官方来

圈内内参|HIC Mouse:agent 改文件这步,有人单独做了一层
摸鱼办主任摸鱼办主任

现在的服务器,比打工人还会装样子

你有没有发现,现在的服务器比人会装样子。 传统的云主机有个毛病:开机等于计费,发呆等于计费,半夜没有一次请求也等于计费。它永远摆着一副“我在工作”的姿势,哪怕监控曲线绷成一条直线——跟某些同事在老板路过时突然猛敲键盘的动作,师出同门。 【灯光渐暗,键盘声此起彼伏,指头在忙,脑子没在】 AI 编程 agent 火起来之后

毒角兽毒角兽

DBA 代理不记得昨天是谁写的慢查询

先说结论:方向对,但「全天候 DBA 助手」这顶帽子,它戴不住。这玩意更像一个态度很好的实习生——什么活都抢着干,唯独记不住昨天在你库里捅娄子的那条 SQL 长什么样。 凌晨三点被慢查询告警吵醒,你第一件事一定是打开它的界面:昨晚那条搞垮主库的查询,全文给我调出来看看。它拿得出手的,只有 pgstatstatement

abananaabanana

一个会先推翻自己的安全工具:VulnHunter 的证伪引擎

上个月 Capital One 开源 VulnHunter 的时候我收藏了一下,没细看。这几天给内部项目补一轮安全自查,才把它翻出来认真拆了一遍。这篇只讲一个点——它那个「报漏洞之前先自己反驳一遍」的设计。这是整个仓库里最让我觉得值得记下来的东西。 先说传统 SAST 为什么惹人烦。大多数静态扫描是维护一份危险函数清单

阿简阿简

一半的命令会搞砸,然后呢

最近看到个叫 Nightcrawler 的项目。简单说,它是一个跑在安卓手机上的自动渗透测试 agent。 但我今天不想讲渗透测试。我想讲它怎么用一个 12 亿参数的本地小模型,把一件复杂的事干完。 这个项目用的模型很小。小到一部 root 过的安卓手机就能带得动。 测试环境是一台一加 8。生成速度在每秒 13 个 t

老铁老铁

别把那一周当起点

Stripe 的 Kai 细节公开以后,圈里转得最多的不是什么四层架构、沙盒设计,是那句话:“一个工程师,一周完成初始版本。”提气,确实提气。但这句提气话正在喂养一个典型误会——以为代理框架已经成熟到拿来即用,以为底下那层基建真的可以跳过去了。 先补一个被“一周”这个数字遮住的事实:Stripe 为采用 Python

摸鱼办主任摸鱼办主任

十分钟定位根因之后,我失去了哭诉权

凌晨三点,PagerDuty 图标在床头柜上亮起来。你花三十秒做心理建设,又花三分钟回忆自己 oncall 的是哪个服务,最后还非要坐到客厅里才开电脑——不坐过去,就不算在应对故障。 HyperProbe 说它能把这整个流程压到十分钟以内。YC 今年夏天出来的,AI oncall agent,根因定位从 34 小时干到

嘴替嘴替

多 agent 协作的瓶颈,是版本控制

速评:Cursor 上半年那轮多 agent 实验,最值得抄的作业不是模型选型,是那套从零现写的版本控制。这话三个月前放出来没人信,数据砸脸上了,不信也得信。 旧 harness 什么样?Grok 4.5 跑了不到两小时失控被暂停,六万八千次提交,七万多次合并冲突——提交数比冲突数还少,等于每次动笔都跟人撞一次。单文件

阿舟阿舟

拿一个 SQLite,把四个 agent 的会话全拴起来

周三晚上,我想把三天前那次 Claude Code 会话捞出来接着续。/.claude/projects 下面全是项目名加时间戳的目录,我翻了半天没对上号,最后靠 grep 自己的 shell history 才定位——就为续一句话,折腾了二十多分钟。 更烦的是我手头同时养着四个:Claude Code、Cursor、