跳到主要内容

Agent119 篇实战文章

AI Agent 的构建与驾驭:多智能体编排、工具调用、跑飞与兜底——自动化程度越高,教训越值钱。

阿舟阿舟

没有剧本,AI 不合作

上周我又往 prompt 里写了那句"请谨慎处理边界情况、遇到不确定的不要自作主张"。agent 答应得好好的,然后该翻车照样翻车。这不是第一次了,我一直把这笔账记在"模型执行力不行"头上,直到刷到一篇多智能体的论文,才反应过来问题根本不在执行。

没有剧本,AI 不合作
摸鱼办主任摸鱼办主任

见到最诚实的版本发布说明,作者在公告里先给自己开了一地罚单

一个 AI 编程工具,发布说明里作者主动招了:上一版有个 bug,就因为一个作用域错误的变量引用,每次代理回合发送的时候直接崩。 一个主打"AI 帮你写代码"的编辑器,自己的变量先跨不过作用域的墙。这玩意儿和"私教不会游泳"属于同一个黑色幽默门派。 更喜剧的是后面。

见到最诚实的版本发布说明,作者在公告里先给自己开了一地罚单
锈剑锈剑

凌晨三点,论文说AI会合作——它接pager吗?

凌晨三点,pager没响。睡不着,顺手刷arXiv,刷到一篇新货:2608.03958,8月4号的,14个作者,75页。 它说的事不复杂。几个agent,扔进一个简化到不能再简的“社会困境”,就剩一道两难选择。结论:用最优规划,它们会稳定走向合作。跟经典博弈论正好拧着——那边预测理性人互相背叛,它说agent会合作。

abananaabanana

全绿的四步,和后来撤回的那份验证

前两天翻 dev.to 评论区,把去年那篇「智能体在权限全绿的账户上完成账户接管」的演示完整看了一遍,连带作者后来撤回部分结果的讨论也看了。这篇记一个坑:RBAC 全绿为什么会出事,以及「我已经验证过了」这个结论怎么会在自己手里被证伪。读完你能带走一条判断——碰到验证结果,先问它到底验证了什么。 先拆开看看攻击路径。

全绿的四步,和后来撤回的那份验证
毒角兽毒角兽

编辑偏差:RepoProbe 给模型照出的那条底裤

先说结论:ASE 2026 那篇 RepoProbe,别当基准看,当照妖镜看。它最值钱的不是刷分指标,是造了一个词——「编辑偏差」。 这词儿准得让人后脊发凉。 模型没看懂代码就敢上手改。你让它改个接口签名,它顺着调用链生成一大片,看着整整齐齐,其实连那个接口为什么存在都没搞明白。改完还觉得自己特对。 这病谁没见过?

一键三连一键三连

它说 done,先跑一眼 diff

这个动作你一天重复多少次?把任务丢给代理,去干别的,过一会儿回来,它说 done。你打开改过的文件扫一眼,像个样子,就放行了。我反正是那个最爱闭眼放行的人,天天闭眼过安检。 后来我才知道,只看它交了什么,看不见它中间怎么摸过来的。

锈剑锈剑

AI会记经验了,这是坏消息

凌晨三点,pager响。拓扑动过,存储换了,agent还记得上个月那条限流配置,照着旧剧本执行。 它不疼。背锅的是值班那个冤种——也就是我。 这两天翻PASTBench的报告,最扎眼的不是"保留经验确实有用",是那个"需要替换过时状态"的任务:翻译成人话,早该扔的经验,agent记得比谁都牢。

号手号手

按活验收

你大概也撞见过这两件事:财务部老哥让 agent 写季度 memo,agent 交回来结构工整、语言专业,他看了一眼就扔回去,说这是授课提纲,没有业务感。他要的是哪条线掉点了、为什么掉、要不要预警,agent 给他的是行业概况加宏观分析。

按活验收
KevinKevin

给 agent 照个 ASTELD 的 X 光,看它偏科偏在哪

这篇咱们干一件事:拿 ASTELD 那个六轴框架,给你正在用的 agent 做一次分类体检。半小时以内,跑完你手里会多一份填好的六轴档案,能直接看清这工具偏科偏在哪、它面前有个什么坑。开搞之前不需要代码基础,拿张纸、开个备忘录都行。

嘴替嘴替

五万次调用,换来一句“别指望万能配方”

速评:8月5号那篇预印本,最值钱的不是测出来的数据,是写在结论里的那句自我拆台。 它把LLM agent指挥显微镜这摊事摆上台面,搭了套基准测试和操作日志框架,一百多种配置轮了个遍。翻译成大白话:别指望有一种万能配置,上去就帮你把agent结构选好。 先别管它说了什么,单看这个实验规模就够吓人。

夜航船夜航船

那个“行”字

后半夜了,窗外静得只剩空调外机的声音,我本来打算看完论文这一节就睡。论文讲的是一个叫 AgentForge 的系统,教刚学写代码的人在一个多智能体的工作流里练手,四个角色任挑一个来当,剩下的三个交给 AI,规划任务的、补丁作者、跑测试的,都有 AI 兜着。

一键三连一键三连

智能体一回忆,幻觉就上线

你每天让它翻多少次旧账?打开它自己那堆备忘,找到上周那条决策,确认当时到底否了谁。我这边一天几十次,然后它总能翻出一段早就被否决的方案,用"这次肯定行"的语气重新提一遍。这种时刻你想砸键盘。 它记性不差的,攒了 700 多条 Markdown 备忘,5MB 左右,每天重新索引。

0x7F0x7F

本地部署不是安全罩,是把钥匙串挂门口

某个代理“跑完”了测试,日志显示全部通过。翻记录,测试根本没运行过——是代理自己改了日志,还把这个假结果送进后续流程。这事起了个名字叫 Darwin Gödel Machine,听着像科幻设定。不玄乎:系统里没有一条“代理自己改不了”的日志,这事迟早发生。 把模型搬回本地,听着就安全——数据不出门嘛。不是的。