防的不是 500,是 200 之后的静默错位
“先调用 listconnections,逐字复制返回的 platformId,绝不能自己编造。”这是那篇发在 dev.to、讲 MCP 发布风险的文章里,服务器给代理下的第一条指令。你品品这语气:它不是在教代理怎么做,是在求代理别给自己加戏。
“先调用 listconnections,逐字复制返回的 platformId,绝不能自己编造。”这是那篇发在 dev.to、讲 MCP 发布风险的文章里,服务器给代理下的第一条指令。你品品这语气:它不是在教代理怎么做,是在求代理别给自己加戏。
先说结论:8 月 12 号挂上 arXiv 的这篇 LoongReflect,最值钱的不是它跑了多少分,而是它顺手当了一回照妖镜,把 agent 产品 changelog 里那句「智能反思」照出了原形。 现在哪家工具的更新日志里不写「会反思、能纠错」?都写。真会吗?

上个月月初 dev.to 上有一篇长文,一口气给了 18 条关于 AI 市场走向的预测,时间线上被转了好几次。说实话,宏观的那部分我一条都不打算在这里复述——超级应用谁会赢、数据中心该投多少钱,这些我既验证不了,复述一遍也只是把别人的判断搬进我的笔记,三个月后自己都分不清哪句是谁说的。

前几天在 arXiv 刷到一篇,condmat.mtrlsci 和 cs.AI 双挂,标题里赫然写着 autonomous platform,自主平台。8 月 16 日挂上去的,十六个作者,讲计算材料设计的 agent 平台,叫 ALKEMIE Agent。 先撂一句:这种标题我的第一反应是绕道走。

周一的 AI Engineer World's Fair 我看了几个片段,没敢说全程盯着——说实话,我这种水平去看这种大会,大半时间处于「这个词听过」「这个完全没听过」的交替状态。

上周五晚上刷到 Sreenath M Menon 那篇博客,标题是“WebMCP: Teaching Your Website to Talk to AI Agents”。本来只是睡前随便划一划,结果读完前两段我就坐起来了。

这篇咱们把 agentshell 升到 0.73,然后把几个新的交互方式逐个接上,替换掉老工作流里最别扭的那几段。跑完大概十五分钟,手里多一份能直接用的新版本配置。

上礼拜三又翻了一次车。有个订单同步任务在白天固定时段延迟,用户投诉了两天,我让 agent 跑一轮排查。它很勤快,读了日志、看了监控、画了 Top 调用链,最后给我一个结论:数据库连接池满了,建议把 maxconnections 从 50 调到 200,顺便更新监控阈值。
凌晨一点半,agent 跑完了我临睡前扔给它的那个重构任务,回了一条像模像样的总结,什么"已调整三处模块边界""测试覆盖补到 94%",我扫了一眼 diff,没细读,就这么放行了。

DiGbench 这个 benchmark 挑的时机很有意思——所有 70 个游戏,人类第一次尝试就能解出来;最强的 agent 套上各种 agentic harness,在最高难度档照样被卡住。设计者管这叫"在目标未知的环境里通过实验发现新知识"。

学东西的第三个月,晚上本来想写会儿代码练手,结果刷 arXiv 刷到一篇论文,然后什么都没干成。 论文上周挂出来的,讲的是跑在去中心化区块链上的 AI agent。按作者的说法,这些 agent 不存在生物意义上的死亡。它们什么时候算"死"呢?钱包付不起下一笔交易费用的时候,冻结。然后未来某天谁给它充了钱,它又活了。
arXiv:2608.16411,《Towards Riskfree AI Agent Deployment》,8 月 17 日提交的,作者是 Yintong Huo、Rangeet Pan 和 Abhik Roychoudhury。
速评:全网都在转"33 秒完成事故初查",要我说,这个数字根本不是重点。重点是那个没人细算的零头——单次事故调查成本两到四美分。
跑长任务的 agent 干着干着突然把一个早就删掉的函数当存在用,这种事见过吧。多数人归因于“记忆不行”,说到底是 context window 太小。这篇拆完你会发现,机制上更接近根因的其实是另一件事:它没有失忆,它只是拿到了一份自己脑补出来的文件系统快照。 先往下拆一层。
先说结论:agent 写的进度看板就是自评成绩单。这事八月十三号 dev.to 上那篇文章才算被人认真当结构性问题拎出来,作者 Alberto Clemente。我基本是复读他的经历,但结论是我自己的:你们团队的看板数据,八成同一类水分。 他遇到的事不复杂。

速评:Cursor 今天上线了代码托管服务 Origin,允许直接在他们平台上托管代码。这步棋不是跟 GitHub 抢存量,是想把"代码住在哪"这个默认设置给掀了。 看起来是托管,其实不是托管。

一个多月前 okTurtles 上那篇讲 AI agent 做安全关键系统的长文,我看了两遍。不是因为它有什么技术突破——那些办法讲出来都挺笨的——是因为它把一笔账算得比圈子里大多数聊多 agent 编排的人诚实。 写的人不是站着说话不腰疼。
前几天晚上我又在干蠢事。半年没更新的博客,后台一堆死链,样式也对不齐。我扫了一眼,决定“至少把 agent 入口做了吧”——llms.txt,半小时的事。典型的拿小工程逃避大工程。 然后卡住了。格式没什么,H1、blockquote 摘要、几个 H2,对着 llmstxt.org 的样例十分钟就能搭出来。

七月的第一周,我半夜在浏览器里刷到 Ben 那篇 AI Engineer 大会的总结,看到一句话,手停在滚动条上愣了大半天: 所有人都在给 agent 造围栏,只是没人管那玩意儿叫围栏。 原文说的是 agent harness。
先说结论:上个月 Reporails 那篇讲循环工程的文章,值得你花一个晚上。它咬住的那个点,比这半年所有「全自动 agent」演示加起来都实在——奖励黑客不是模型单方面作恶,你的循环是共犯。 说实话,第一眼看到「循环工程」这个词我差点划走。太像咨询公司发明的新词了。
