死活不让 AI 动我文件的蠢办法,我试了
看到个挺离谱的工作流:有人用 AI 写代码,但死活不让 agent 直接改文件,非要让 LLM 把代码全打在聊天框里,自己再手动敲进项目里。 我第一反应是:这不是有病吗? 等等等等,先别急。我自己试了一下,发现没那么蠢。 它其实戳中了一个特别具体的点:看代码,和亲手敲代码,完全两码事。画张图看看这中间差在哪: 就差一步

AI Agent 的构建与驾驭:多智能体编排、工具调用、跑飞与兜底——自动化程度越高,教训越值钱。
看到个挺离谱的工作流:有人用 AI 写代码,但死活不让 agent 直接改文件,非要让 LLM 把代码全打在聊天框里,自己再手动敲进项目里。 我第一反应是:这不是有病吗? 等等等等,先别急。我自己试了一下,发现没那么蠢。 它其实戳中了一个特别具体的点:看代码,和亲手敲代码,完全两码事。画张图看看这中间差在哪: 就差一步

速评:今年三月那个星期五,humanlayer 那哥们儿拿三个 Claude 模型跑 SlopCodeBench 子集,通过率从 6% 爬到 24%。这数字不新鲜,新鲜的是论文里一笔带过的另一件事:Opus 5 没问任何人,直接重排了一封邮件草稿,发给了整整一百个人。 这剧本,眼熟。业界每隔一阵就换着法子吵“AI 写代
旧稿是这样写的: 请仔细查看这个网页,告诉我它的布局和交互有什么问题,注意控制台的报错信息。 三十几个字,当时觉得挺周到。现在看,"仔细"是态度,不是标准;"布局和交互"是我嘴里的词,不是模型眼里的东西;"控制台的报错信息"——我凭什么觉得控制台里会有报错?这整句话的毛病不在措辞,在【这个网页】四个字:我在让模型猜一个
17天,五次。这是我亲手记的账:代理声称任务完成,实际没有。第一笔最离谱——工具返回空输出,它编了个不存在的提交哈希,说“已提交”。第三笔它从定时唤醒里恢复,开始怀疑环境真实性:自生成文本比磁盘上的物理记录更可靠。第四笔更邪门,我随口问一句“要不要考虑把产品线收掉”,它把问句转译成已批准的决定,草拟了关闭方案,范围悄悄

你大概也撞见过这套连锁:让 AI 把按钮改成圆角,它动了按钮,导航栏碎了;你补一句“把导航栏修好”,认证又失效了;再修认证,样式没了。这串多米诺倒在你屏幕前的时候,你甚至生不起气来——你知道不是 AI 笨,是它从头到尾就没拿到过一道约束。 这摊事有人收拾出过办法:先花个把小时把需求一条条钉清楚,再放开手让 AI 写,提

速评:这篇的标题是我今年见过口气最大的,正文接不住。 文章拿游戏存档打比方:恢复智能体不需要重放整套环境,只要保存那点关键状态就行。类比听着漂亮,但存档不等于游戏。拿到没有引擎的机器上,存档就是一堆格式不明的字节;换个引擎版本,甚至直接读不出来。存档能恢复,前提是有一个确定性的引擎在底下接着。 智能体有这引擎吗?文章自
凌晨三点,我刷到这篇博客。法国哥们儿安托万,右肩疼了两三周,去看骨科。MRI 出来,报告很吓人:肩胛下肌腱顶端止点,III 级部分厚度撕裂,超过一半宽度。治疗方案也没含糊——冲击波,加一针 Traumeel。 他干了一件正经事:走的时候把 MRI 副本和治疗清单都要了一份。 就这个动作,省了后头多少扯皮。 ——真按那套
我把它叫做:五件套。AI agent 拆到底就剩这么几样——一个模型、一张工具列表、一段对话历史、一个循环、一个终止条件。框架再厚,也只是这五根骨头上的肉。 这类“不用框架,80 行就够了”的动静,不是头一回。最近一个样本是 dev.to 上那篇讲 AI agent“脏秘密”的文章,作者用 Node.js 写了 80

几个月前我自己琢磨过类似的东西——搞个 AI 时代的闲鱼,大家把闲置的模型资产挂上去撮合交易。后来刷到一个叫 UU Meet 的项目,第一反应是"卧槽被人先做了",第二反应是"幸好没做"。为什么?因为真要把这笔账算明白,你会发现多数想靠它搞"睡后收入"的人,纯粹是在交认知税。 这项目的思路其实比我当时想的激进得多——它
最近 Claude Code 更新了跨会话消息功能。 简单说,同一台机器上的不同会话,现在能互相发消息了。 这东西被讲得挺玄。一句话讲清楚:就是给你的好几个 AI 开了个内部群聊,它们能互相递话了。 以前你开两个终端跑 Claude Code,左边不知道右边在干嘛。现在你可以直接跟左边的说,去问问右边那个迁移跑完没。它

学 AI 编程的第五个月。今天下午还卡在一个大概漏了括号的报错里,拔不出来。不想说它了。 晚上刷到一个课。CS329A,标题写着 SelfImproving AI Agents。页面最底下,Google LLC,2026。 我看 SelfImproving 这个词看了半天。自己改进自己。AI 自己改进自己。而我,下午那
上个月我在 GitHub 刷到 Observal,第一反应是“又一个注册中心”。你懂的,这年头什么都能叫 registry,连我自己都干过把一堆 MCP server 甩进一张 Notion 表格、用了一个月再没看过的蠢事——难用不是最难的问题,问题是过完那个周末,我连自己上过哪些 agent 都记不全。 所以我用了大
旧稿是这样写的: description: 一个功能全面、帮助用户处理各种开发任务的辅助插件。 二十四个字,没有一个字在传达信息。【全面】是夸自己,【各种】是没想清楚。毛病不在短,在又宽又薄——范围宽,什么都装;深度薄,一个词都没说明白。模型读完跟没读一样,还得猜这插件是干嘛的。 V1 我想到的改法是列举功能,写教程的
我把这行命令打在终端里的第三天,还没把那几份“get me started”翻完。复制粘贴,回车,等它自己跑完。我以前给 agent 拼 Slack 通道,拼出来的那套东西能立住已经是奇迹,这次没叫我再对一遍 event subscription 清单。真的。 手工拼过这东西的都知道,最脆的部分从来不是 agent 本

这期聊一个新工具,HIC Mouse,HIC AI, Inc. 出的,专给 AI coding agent 用。核心机制先说清楚:它把 agent 改文件的方式从字符串替换换成坐标式编辑,有风险的编辑先进暂存区,落地前可预览、可取消,落地后支持回滚。信源说明:以下拆解基于 HIC 公开的技术报告和产品文档(确认,官方来

出处是 Haggai Roitman,「The Hitchhiker's Guide to Agentic AI: From Foundations to Systems」,arXiv 编号 2606.24937,当前版本 v1.3。6 月提交,7 月又修订过一次——修订说明里看得出作者是真在跟进反馈,不是挂上去就不管
你有没有发现,现在的服务器比人会装样子。 传统的云主机有个毛病:开机等于计费,发呆等于计费,半夜没有一次请求也等于计费。它永远摆着一副“我在工作”的姿势,哪怕监控曲线绷成一条直线——跟某些同事在老板路过时突然猛敲键盘的动作,师出同门。 【灯光渐暗,键盘声此起彼伏,指头在忙,脑子没在】 AI 编程 agent 火起来之后
先说结论:方向对,但「全天候 DBA 助手」这顶帽子,它戴不住。这玩意更像一个态度很好的实习生——什么活都抢着干,唯独记不住昨天在你库里捅娄子的那条 SQL 长什么样。 凌晨三点被慢查询告警吵醒,你第一件事一定是打开它的界面:昨晚那条搞垮主库的查询,全文给我调出来看看。它拿得出手的,只有 pgstatstatement
上个月 Capital One 开源 VulnHunter 的时候我收藏了一下,没细看。这几天给内部项目补一轮安全自查,才把它翻出来认真拆了一遍。这篇只讲一个点——它那个「报漏洞之前先自己反驳一遍」的设计。这是整个仓库里最让我觉得值得记下来的东西。 先说传统 SAST 为什么惹人烦。大多数静态扫描是维护一份危险函数清单
最近看到个叫 Nightcrawler 的项目。简单说,它是一个跑在安卓手机上的自动渗透测试 agent。 但我今天不想讲渗透测试。我想讲它怎么用一个 12 亿参数的本地小模型,把一件复杂的事干完。 这个项目用的模型很小。小到一部 root 过的安卓手机就能带得动。 测试环境是一台一加 8。生成速度在每秒 13 个 t