先说结论:Substack 上线 Pangram 检测这事儿,问题不在准不准。在于它把「透明度」和「AI 使用」搞混了。抓错对象,越准越糟。
官方口径是 Chris Best 那句定位——给读者提供选择,不是禁止 AI。听着挺克制对吧。翻开实现:一百字以上的帖子、笔记、评论,全扫。
全扫。
「给读者提供选择」和「全量扫描打标」是两码事。前者是信息,后者是裁判。这不叫克制,这叫话术。
数字好看,乘一下就露馅
Pangram 宣传里那套准确率话术,照例是「科幻小说」级别。99.98% 这种数字单看很唬人。
乘上 Substack 的体量呢?数百万篇帖子的规模,哪怕真到 99.98%,误报的绝对数量照样一大片。每个误报背后是一个真人的名字。
这笔账不是我发明的。一位叫 Nwaneri 的作者算得很清楚,他自己就是被咬过的人——当年在 DEV.to,社区成员拿 GPTZero 扫他的文章,被标记的两篇,恰恰是当年引发最多技术讨论的两篇。
对,写得越好越像 AI。写得烂反而安全。
这个结构性毛病,Chris Best 自己都在发布说明里承认了:Pangram 判断不了文本有没有投入心思,只能判断句子模式像不像机器输出。翻译一下:它抓「形态」,不抓「思考」。那这标签贴给读者,读者读出来的是什么?
误报不是边角料,是主要产出
几个实测级案例,不是我编的。
Marco,四十年技术经验,意大利语母语,用 AI 把英语润得自然一点,被 DEV.to 那套警告流程标记。一位俄罗斯系统工程师更直接:检测器因为文档写得太精确而标记他,那它惩罚的是工程严谨性。
还有更绝的。一位用户贴出来:他 2017 年写的博文,被检测器以 97% 置信度判为 AI 生成。2017 年!这模型还没出生,文章先成了 AI 写的。这波真冤,冤到好笑。
非母语误报这个坑,多所大学踩过一圈、直接禁用 AI 检测器了。Pangram 声称镜像提示训练解决了这个问题——数据呢?主要是 Pangram 自家或委托的研究,独立验证欠奉。厂商自己的验证报告,按惯例只能当主张清单,不能当结论。
The Atlantic 有记者把一串 AI 写作指控追到了 Pangram 头上,包括一本恐怖小说发行前几天被出版社撤回。那位记者有个判断我完全同意:可靠度较高的检测器比明显不靠谱的更危险——因为大家会停止核查它的判断。烂检测器人人怀疑,好检测器人人跪。跪着用工具,比没有工具惨。
真正打脸的是评论区
有位用户说,他发了约四十篇重度 AI 辅助的文章,从没被标记过。
为什么?零参与度。没人看,没人扫。
沉默才是真正的检测器。读者用脚投的票比 Pangram 的置信度准。这条观察把整套功能的必要性直接戳了个洞——Substack 的分发本来就看订阅和互动,AI 垃圾文在没有流量的地方自己就死了,扫它干嘛?扫得着的都是有人看的,有人看的往往被讨论,被讨论的往往写得好。
这套系统天然往最不该标记的地方使劲。
另一条评论也扎得准:有动机逃避的作者会迭代着绕过检测,撞上枪口的永远是不设防的诚实人。公开的检测器就是个对抗性分类问题,武器化之后,猎物先学会隐身,庄稼先挨枪。
披露政策在奖励不诚实
这条是我最想说的。
Nwaneri 自己的处境就很典型:英语是他的教学和思考语言,AI 是他从草稿到成稿流程的一环,不是替他生成观点的。他甚至放弃了通用 humanizer,拿自己已发表的语料训了个保留个人声线的版本——这是个真把写作当回事的人。
结果呢?在这套披露体系里,承认用 AI 的被标记,不承认的安然无恙。同样质量的 AI 辅助内容,系统抓到的是坦白的那批。
这不是检测 AI,这是检测诚实!
还有个校准层面的死结:训练数据里带「AI 辅助」标签的,全是承认了的人。没承认的同等内容就是一片未测量的假阴性。检测器对着自选样本校准,再宣称对全体有效——这套话术我们见过太多遍了。
锐评评分卡
Pangram 自己的数据说,Substack 是它扫的平台里 AI 内容率最低的,远低于 LinkedIn。也就是说,Substack 拿自家最干净的场地,上了套最激进的扫描。这钱花得冤不冤?
冤。不冤在技术上——Pangram 在检测器里算做得认真的,镜像训练这条路至少是在正视风格误报,比 GPTZero 那代强。冤在产品决策:把一个只会认「句子形态」的工具,摆到需要判断「心思」的位置上,还全量铺开。
Chris Best 嘴上说「不是禁止」。可标签一旦贴出去,读者不会去读发布说明里的限定语。工具的谦虚写在文档里,工具的暴力跑在生产环境里。
这条我还没测完——Pangram 对中文写作的误报率什么样,我准备拿几篇老文章去照一照,下篇再说。先别信我这半句。
照妖镜得先照得准人。照谁都像妖的镜子,就是哈哈镜。
