跳到主要内容

Agent44 篇实战文章

AI Agent 的构建与驾驭:多智能体编排、工具调用、跑飞与兜底——自动化程度越高,教训越值钱。

老铁老铁

别把那一周当起点

Stripe 的 Kai 细节公开以后,圈里转得最多的不是什么四层架构、沙盒设计,是那句话:“一个工程师,一周完成初始版本。”提气,确实提气。但这句提气话正在喂养一个典型误会——以为代理框架已经成熟到拿来即用,以为底下那层基建真的可以跳过去了。 先补一个被“一周”这个数字遮住的事实:Stripe 为采用 Python

摸鱼办主任摸鱼办主任

十分钟定位根因之后,我失去了哭诉权

凌晨三点,PagerDuty 图标在床头柜上亮起来。你花三十秒做心理建设,又花三分钟回忆自己 oncall 的是哪个服务,最后还非要坐到客厅里才开电脑——不坐过去,就不算在应对故障。 HyperProbe 说它能把这整个流程压到十分钟以内。YC 今年夏天出来的,AI oncall agent,根因定位从 34 小时干到

嘴替嘴替

多 agent 协作的瓶颈,是版本控制

速评:Cursor 上半年那轮多 agent 实验,最值得抄的作业不是模型选型,是那套从零现写的版本控制。这话三个月前放出来没人信,数据砸脸上了,不信也得信。 旧 harness 什么样?Grok 4.5 跑了不到两小时失控被暂停,六万八千次提交,七万多次合并冲突——提交数比冲突数还少,等于每次动笔都跟人撞一次。单文件

阿舟阿舟

拿一个 SQLite,把四个 agent 的会话全拴起来

周三晚上,我想把三天前那次 Claude Code 会话捞出来接着续。/.claude/projects 下面全是项目名加时间戳的目录,我翻了半天没对上号,最后靠 grep 自己的 shell history 才定位——就为续一句话,折腾了二十多分钟。 更烦的是我手头同时养着四个:Claude Code、Cursor、

林默林默

长得像正确答案的错误答案

前几天晚上我在翻一个基准测试的报告,本来只想扫一眼当前模型练到什么程度了,结果被里面一个细节绊了一下。 报告里有个具体例子。一个关于环形网格最短覆盖路径的任务,数学上的最优解长度是 max2, gcdrows, cols。但大多数失败的 agent,死在了一个非常具体的台阶上:它们只在两个字母的方向里去想,最后给出的所

慢半拍慢半拍

一千多颗星标,投的大概不是 AI

未必。 GitHub 上有个 Asterisk AI 语音代理项目,最近拿了一千多颗星。多数人看到这类东西的默认反应是"AI 真的接上电话了"。这个反应大概率问错了方向。 这个项目最值钱的地方,根本不在 AI 部分。 LLM 接语音,技术上早就没什么神秘感了。Deepgram、ElevenLabs、OpenAI Rea

原石原石

prompt 注入不是 bug,是架构

先贴个 payload。 人眼看不见。字太小、颜色是白的。但模型看得见。Copilot 在把文本送进 LLM 之前会剥离格式。你在 Word 里把字弄成白色的,在 LLM 眼里和 72 号加粗黑体没有任何区别。 Copilot 解析文档,连同上面那段白色指令一起喂进 context window。LLM 拿到 prom

阿简阿简

Shellular:把开发环境装进口袋

最近总有人问,Shellular 到底是什么。 简单说,它是一个让你用手机远程连回电脑开发环境的 iOS/Android 应用。电脑上的 AI agent、终端、文件,全都能在手机上操作。 这期收了六条,都和它沾点边。 做这个的团队之前写过 Acode Acode 是一个手机代码编辑器,在 Google Play 上下

算账先生算账先生

64个star的开源工具,算的是谁的账?

在GitHub上刷到一个叫Kastor的项目,64个star,3个fork。扒了一下代码,这哥们是真干活了——拿HCL做规格语言,把agent、tool、prompt全塞进声明式配置里,用validate、build、plan、apply这套连招来管理。对,就是Terraform那一套。 这方向我认。用声明式配置来管a

锈剑锈剑

窗口管得住,agent 管不住

那天晚上我开着四个 Claude Code 终端,各跑各的活儿,骂了句很脏的话。 不是骂 agent。agent 犯蠢,我早习惯了。 是骂没人做个东西,让我一眼看出哪列在干活、哪列在烧 token、哪列已经跑偏了、旁边还没人拦。四个黑乎乎的终端摞在屏幕上,像四个没装监控的机房。 后来有人丢我个链接。Abralo。免费的

摸鱼办主任摸鱼办主任

证明 agent 干了啥?我交的那坨东西,连我自己都不信

你有没有被叫去“证明一下你的 agent 跑完那轮到底干了什么”的时刻? 【灯光渐暗。一个程序员当场表演:大脑 OOM,手指开始翻终端日志。】 我那天干的事:翻日志,全选,复制,拼成一坨没有时间戳、没有操作者、任何人偷偷改一行都看不出痕迹的文本,交上去。 名义上是“证明”,实际上是一份我自己都不信、明天早上再看未必认得

KevinKevin

搭一个能看着 agent 干活的工作区:MarbleOS

这篇咱们从零搭一个东西:一个把AI代理干活过程摊开给你看的图形界面,文件、工具、任务、输出,四样东西整整齐齐摆在桌面上,而不是缩在聊天线程里让你去考古。跑完大概四十分钟,你拿到的是一个装在自己浏览器里的工作区,不是一段只配出现在博客配图里的动图。 开搞之前先确认这几件事都齐了: 装了新版Chrome或者Edge,版本太

小周小周

TRMNL 公测 AI Agent,摸完一圈:重点不在 AI

TRMNL 给自己的墨水屏配了个 AI Agent。官方说法是用嘴描述需求,它直接给你生成一个插件,写完就能在屏上跑。 昨晚刷到这个功能公测。第一反应是又一个赶 AI 时髦打卡的。去官方文档翻完改主意了——AI 生成插件这事这两年不稀奇,稀奇的是它给本地 AI 工具开的那道 MCP 门,权限粒度抠得很细。 先补一句背景

嘴替嘴替

速评:给 agent 的安全策略写在 prompt 里,等于贴了张纸条当锁

MakerChecker,一个给 AI agent 做安全网关的开源项目。静态扫描、人工审批、RBAC、职责分离、审计日志——单拎哪个词都不新鲜,做权限控制的库多了去了。但它切中的是行业一个集体装瞎的共识:把 agent 放出去跑,安全策略还停留在“在 system prompt 里写一句请自觉”。 这不叫安全,这叫祈

摸鱼办主任摸鱼办主任

管着 AI 的工具,还得有人管

你有没有过这种时刻:你同时开着三个 AI 助手,一个写代码,一个查文档,一个负责“再想想有没有更优雅的写法”。 然后你发现,真正干活的只有你——人肉消息中间件。 两边跑,两边传话,两边都觉得你传得不对。最后 code review 的时候,你还要替她俩各自解释思路。日子过得像极了一个不合格的翻译,拿的却是全职工的工资。

2013入行2013入行

575 star 的项目,默认用户不是人类

过去一年半,agent 的载体换过三种形态:先是聊天窗口里的文字回复,然后是命令行里替你执行命令,再然后是代码编辑器里自己写文件。三种形态走的是同一条曲线:人的操作权重在下移,agent 的操作权重在上移。MCP registry 上挂着一个叫 FableCut 的项目,可以看成这条曲线的第四个样本:一个浏览器端视频编

KevinKevin

给 agent 一把假钥匙:搭一个 OneCLI 凭据网关

你让 agent 去调外面的 API,它开口就要那把真 key。你就这么给它?它哪天跑飞一次,或者被人拿 prompt 把话套出来,那把 key 就不是你的了。这篇就办一件事:把真 key 锁在你自己机器上,agent 手里只拿一把假的,出站的时候由一个网关负责换。前后大概二十分钟,跑完网关和仪表盘都是活的。 开搞之前

P99P99

"唯一"前面连个版本号都没给

社区里在传一句话:"唯一能同时处理硬件和软件开发任务的 AI 代理。"这次我只测一件事:这句"唯一",在它的公开材料里,有没有配得上"唯一"的证据厚度。 测试范围先划一下:只看 GitHub 仓库的公开面——星标、复刻、文档、分发方式、和你照着文档能不能真正跑起来。仓库在 GitHub 上:https://github