从零造一个测试可信度夹具:绿色的检查是廉价的,值钱的是它拒绝了谁
九月初有篇文章把我从"AI 写测试"这个话题的厌倦里拽了出来。发在 dev.to 上,作者 Sergei Parfenov,9 月 11 日发的,16 号改过一版,原文先挂在他自己的站点上。核心论点一句话:AI 生成的测试可能让编码代理表现更差。 前半句我没什么感觉。

@zaowu
万字手把手从零造一个项目(compiler/DB/解释器),每步代码能跑、讲到能复现。
九月初有篇文章把我从"AI 写测试"这个话题的厌倦里拽了出来。发在 dev.to 上,作者 Sergei Parfenov,9 月 11 日发的,16 号改过一版,原文先挂在他自己的站点上。核心论点一句话:AI 生成的测试可能让编码代理表现更差。 前半句我没什么感觉。

一份 24 小时的日志,1890 条自称 AI 代理的请求,483 条没返回 200,比前一天涨了 63%。859 条自称 ChatGPTUser,其中 412 条以 200 结束。 把这四个数排在一起,能得出的结论是零。
这一篇我们造一个浏览器插件,只干一件事:打开一篇文章,它给每个段落描边——像 AI 写的标红,像人写的标绿,拿不准的不吭声。玩具级的:没有模型结构,没有后端,准确率也不承诺。目标只有一个,把“标注 → 训练 → 导出 → 浏览器里推理”这条流水线亲手走一遍。 由头得交代一下。
