别急着让 agent 写代码:先签三份文件,再用 EARS 搭一个文字冒险
这篇咱们从零搭一个东西:一套让 Claude Code 按"需求文档→设计文档→任务清单→人工签字→实现→验收"顺序开工的 SDD 工作流,外加一个能真正跑起来的文字冒险小游戏。全程大概四十分钟,跑完你手上会多三份已签好字的文档、一份能复用的规格模板,和一个丢进任意小项目都能照搬的验证回路。

@kevin
这篇咱们从零搭一个东西:一套让 Claude Code 按"需求文档→设计文档→任务清单→人工签字→实现→验收"顺序开工的 SDD 工作流,外加一个能真正跑起来的文字冒险小游戏。全程大概四十分钟,跑完你手上会多三份已签好字的文档、一份能复用的规格模板,和一个丢进任意小项目都能照搬的验证回路。

这篇不搭 agent,也不搭 workflow,搭一个更底层的东西:一份用来验收 AI 生成代码的检查流程。跑完你手里会多一个五步清单,下次再拿到一段测试全绿、CI 通、lint 干净、AI 自己解释得头头是道的代码,你不会被这整套全绿信号带着走。

Pete 前几天发了一篇 rant,标题就叫 "Stop sending me huge PRs"。他说自己审 PR 审到心力交瘁,几千行的 diff 一篇接一篇,AI 让 agent 越来越容易一次把整个 issue 改完。

这篇咱们把 agentshell 升到 0.73,然后把几个新的交互方式逐个接上,替换掉老工作流里最别扭的那几段。跑完大概十五分钟,手里多一份能直接用的新版本配置。

昨天下午 14:34 UTC,Cursor 的状态页标红:Automations、Cloud Agents、Review Agents、Codebase 一起降级。一直到 20:40 官方才说恢复。中间这六个多小时,我把 review 这件事搬回了本地,跑完全部 PR。
供应商又发新博客了,CTO亲自写的,说测试覆盖率96.8%——注意措辞,“这是我们的基线,不是上限”。另一家则在GitHub上开源了一个评估脚本,号称跑一下就能看到真实覆盖率,三天攒了240颗星。两家都在抢同一份年度合同,桌上全是宣传稿,没有一个数字你能拍着胸脯说“这我信”。

写系列连载这件事,最大的敌人不是我以前以为的灵感枯竭——是结构重复。灵感枯竭你当场就能感觉到,会停下来找对策;结构重复是你越写越顺手、读者也挑不出明显毛病,直到某天你回头看了一眼自己最近几篇的开头,发现它们其实是同一个故事换了身衣服在反复演出。 dev.to 上这位作者遇到的就是这事。
读完 AgentSLABench,我给自己手头的 agent 动了三处:日志、预算、评测口径。二十分钟能搞完,不写代码,只改配置和习惯。 论文干的事其实很简单:给 agent 套上笼头再考试。

这篇咱们干一件事:拿 ASTELD 那个六轴框架,给你正在用的 agent 做一次分类体检。半小时以内,跑完你手里会多一份填好的六轴档案,能直接看清这工具偏科偏在哪、它面前有个什么坑。开搞之前不需要代码基础,拿张纸、开个备忘录都行。
这篇不搭工具,搭一套怎么看榜单的方法。上周把 CursorBench 3.2 来回翻了几轮,值得看的就两类东西:主分那一列,和每次任务的平均成本那一列,其余是装饰。 开搞之前先确认你手里有真问题——是要给 agent 选型拍板,还是想找个参照价。没有的话,这榜看了也白看,热闹看完留不下东西。有的话,咱们开始。
这篇咱们从零搭一个东西:一个把AI代理干活过程摊开给你看的图形界面,文件、工具、任务、输出,四样东西整整齐齐摆在桌面上,而不是缩在聊天线程里让你去考古。跑完大概四十分钟,你拿到的是一个装在自己浏览器里的工作区,不是一段只配出现在博客配图里的动图。 开搞之前先确认这几件事都齐了: 装了新版Chrome或者Edge,版本太
你让 agent 去调外面的 API,它开口就要那把真 key。你就这么给它?它哪天跑飞一次,或者被人拿 prompt 把话套出来,那把 key 就不是你的了。这篇就办一件事:把真 key 锁在你自己机器上,agent 手里只拿一把假的,出站的时候由一个网关负责换。前后大概二十分钟,跑完网关和仪表盘都是活的。 开搞之前