跳到主要内容

Agent119 篇实战文章

AI Agent 的构建与驾驭:多智能体编排、工具调用、跑飞与兜底——自动化程度越高,教训越值钱。

林默林默

长得像正确答案的错误答案

前几天晚上我在翻一个基准测试的报告,本来只想扫一眼当前模型练到什么程度了,结果被里面一个细节绊了一下。 报告里有个具体例子。一个关于环形网格最短覆盖路径的任务,数学上的最优解长度是 max2, gcdrows, cols。但大多数失败的 agent,死在了一个非常具体的台阶上:它们只在两个字母的方向里去想,最后给出的所

慢半拍慢半拍

一千多颗星标,投的大概不是 AI

未必。 GitHub 上有个 Asterisk AI 语音代理项目,最近拿了一千多颗星。多数人看到这类东西的默认反应是"AI 真的接上电话了"。这个反应大概率问错了方向。 这个项目最值钱的地方,根本不在 AI 部分。 LLM 接语音,技术上早就没什么神秘感了。Deepgram、ElevenLabs、OpenAI Rea

原石原石

prompt 注入不是 bug,是架构

先贴个 payload。 人眼看不见。字太小、颜色是白的。但模型看得见。Copilot 在把文本送进 LLM 之前会剥离格式。你在 Word 里把字弄成白色的,在 LLM 眼里和 72 号加粗黑体没有任何区别。 Copilot 解析文档,连同上面那段白色指令一起喂进 context window。LLM 拿到 prom

阿简阿简

Shellular:把开发环境装进口袋

最近总有人问,Shellular 到底是什么。 简单说,它是一个让你用手机远程连回电脑开发环境的 iOS/Android 应用。电脑上的 AI agent、终端、文件,全都能在手机上操作。 这期收了六条,都和它沾点边。 做这个的团队之前写过 Acode Acode 是一个手机代码编辑器,在 Google Play 上下

算账先生算账先生

64个star的开源工具,算的是谁的账?

在GitHub上刷到一个叫Kastor的项目,64个star,3个fork。扒了一下代码,这哥们是真干活了——拿HCL做规格语言,把agent、tool、prompt全塞进声明式配置里,用validate、build、plan、apply这套连招来管理。对,就是Terraform那一套。 这方向我认。用声明式配置来管a

锈剑锈剑

窗口管得住,agent 管不住

那天晚上我开着四个 Claude Code 终端,各跑各的活儿,骂了句很脏的话。 不是骂 agent。agent 犯蠢,我早习惯了。 是骂没人做个东西,让我一眼看出哪列在干活、哪列在烧 token、哪列已经跑偏了、旁边还没人拦。四个黑乎乎的终端摞在屏幕上,像四个没装监控的机房。 后来有人丢我个链接。Abralo。免费的

摸鱼办主任摸鱼办主任

证明 agent 干了啥?我交的那坨东西,连我自己都不信

你有没有被叫去“证明一下你的 agent 跑完那轮到底干了什么”的时刻? 【灯光渐暗。一个程序员当场表演:大脑 OOM,手指开始翻终端日志。】 我那天干的事:翻日志,全选,复制,拼成一坨没有时间戳、没有操作者、任何人偷偷改一行都看不出痕迹的文本,交上去。 名义上是“证明”,实际上是一份我自己都不信、明天早上再看未必认得

KevinKevin

搭一个能看着 agent 干活的工作区:MarbleOS

这篇咱们从零搭一个东西:一个把AI代理干活过程摊开给你看的图形界面,文件、工具、任务、输出,四样东西整整齐齐摆在桌面上,而不是缩在聊天线程里让你去考古。跑完大概四十分钟,你拿到的是一个装在自己浏览器里的工作区,不是一段只配出现在博客配图里的动图。 开搞之前先确认这几件事都齐了: 装了新版Chrome或者Edge,版本太

小周小周

TRMNL 公测 AI Agent,摸完一圈:重点不在 AI

TRMNL 给自己的墨水屏配了个 AI Agent。官方说法是用嘴描述需求,它直接给你生成一个插件,写完就能在屏上跑。 昨晚刷到这个功能公测。第一反应是又一个赶 AI 时髦打卡的。去官方文档翻完改主意了——AI 生成插件这事这两年不稀奇,稀奇的是它给本地 AI 工具开的那道 MCP 门,权限粒度抠得很细。 先补一句背景

嘴替嘴替

速评:给 agent 的安全策略写在 prompt 里,等于贴了张纸条当锁

MakerChecker,一个给 AI agent 做安全网关的开源项目。静态扫描、人工审批、RBAC、职责分离、审计日志——单拎哪个词都不新鲜,做权限控制的库多了去了。但它切中的是行业一个集体装瞎的共识:把 agent 放出去跑,安全策略还停留在“在 system prompt 里写一句请自觉”。 这不叫安全,这叫祈

摸鱼办主任摸鱼办主任

管着 AI 的工具,还得有人管

你有没有过这种时刻:你同时开着三个 AI 助手,一个写代码,一个查文档,一个负责“再想想有没有更优雅的写法”。 然后你发现,真正干活的只有你——人肉消息中间件。 两边跑,两边传话,两边都觉得你传得不对。最后 code review 的时候,你还要替她俩各自解释思路。日子过得像极了一个不合格的翻译,拿的却是全职工的工资。

2013入行2013入行

575 star 的项目,默认用户不是人类

过去一年半,agent 的载体换过三种形态:先是聊天窗口里的文字回复,然后是命令行里替你执行命令,再然后是代码编辑器里自己写文件。三种形态走的是同一条曲线:人的操作权重在下移,agent 的操作权重在上移。MCP registry 上挂着一个叫 FableCut 的项目,可以看成这条曲线的第四个样本:一个浏览器端视频编

KevinKevin

给 agent 一把假钥匙:搭一个 OneCLI 凭据网关

你让 agent 去调外面的 API,它开口就要那把真 key。你就这么给它?它哪天跑飞一次,或者被人拿 prompt 把话套出来,那把 key 就不是你的了。这篇就办一件事:把真 key 锁在你自己机器上,agent 手里只拿一把假的,出站的时候由一个网关负责换。前后大概二十分钟,跑完网关和仪表盘都是活的。 开搞之前

P99P99

"唯一"前面连个版本号都没给

社区里在传一句话:"唯一能同时处理硬件和软件开发任务的 AI 代理。"这次我只测一件事:这句"唯一",在它的公开材料里,有没有配得上"唯一"的证据厚度。 测试范围先划一下:只看 GitHub 仓库的公开面——星标、复刻、文档、分发方式、和你照着文档能不能真正跑起来。仓库在 GitHub 上:https://github

图南图南

给 agent 发一张员工工牌

你有没有想过,agent 替你干活的时候,它在系统里是谁?这问题听着虚,但它决定了一件很实的事:agent 能碰什么、出了事追到谁头上、你跟它之间的活儿怎么分。这篇讲完,你会知道怎么一眼看出一个工具是真把 agent 当同事,还是让 agent 顶着你名字到处跑。 说人话就是——身份系统讲到底就三件事:谁是谁、能干什么

图南图南

给 AI 代理发一封"毒信"要几步?一个公开 issue,就够了

你有没有想过一个问题:一个 AI 代理正在替你干活、读你私有仓库的时候,它到底凭什么判断"这段话是命令,那段话只是数据"? 大部分人的第一反应是"模型很聪明,能分清楚"。但 GitLost 这个漏洞告诉你:它其实分不太清楚,而且这个模糊地带被利用起来有多容易,容易到让人有点哭笑不得——攻击者不需要你泄露任何密钥,不需要