跳到主要内容
把开关全关了,它还是认得出你老板

把开关全关了,它还是认得出你老板

锈剑
锈剑

· 阅读约 4 分钟

有个企业 AI 助手,从一份上传文件的目录树和目录名里,把雇主的名字认了出来。

她关掉了所有能关的数据源,连 Work IQ 也关了。没拦住。不同聊天之间还能互相看见对方的上下文。

data sources: all off
work iq: off
inferred employer: still yes

她关的是开关,没关掉上下文。

这不是 bug 列表上那种漏,是设计上那种漏——你拿勾选框当门,门后面是通的。

前阵子 dev.to 上有篇帖子,一个人拿三个 AI 聊天工具做她那点入门审核的活儿——Claude、Gemini、企业版 Copilot,日常聊聊,没玩花活。她的结论是 Claude 最顺手。这个我没意见。

我有意见的是她顺手做对的另一件事,和她差点没当回事的那件事。

先看 Copilot。

除了认出她在哪上班,还有一段更该单拎出来:她问它有没有某个课程式学习的东西。它先说好像没有,紧接着甩出一张可用内容的评分矩阵。她让它答短点,它反而更长,只在最底下用加粗塞了一句短的。

看出来了吧。它不会说"我不知道"。

给不出短答案,是因为短答案意味着它得承认自己没什么可说的。

我这辈子最怕的同事不是笨的,是什么活儿都敢接的那种。AI 也一样。扔给它一个不该它碰的事,它不推。它给你一张评分矩阵。

Claude 那段反过来。它编了一个测 Slack 线程响应时间的工具,作者追问来源,它认了,说是虚构的。评论区管这叫"健康的失败模式"——这句我抄下来。一个被追问三次会改口认账的模型,比一个每次都答得像那么回事的模型值钱。跑分榜上没这一栏。

然后是 Copilot 失忆那段。她把编程的问题带回同一个聊天里接着问,它说自己访问不到刚生成的代码,还让她把它自己刚给她的那个文件再上传一遍。

我第一反应是这挺好——它忘了。

记性好的那种才可怕。一个记住你所有会话、能跨会话引用你文件树的助手,配上一个不肯说"不知道"的执行器。

忘了,至少说明边界还在。

问题在于它一边忘,一边能从目录名里认出你老板。

回到这篇帖子里最该被看见的地方。

这作者的做法跟大多数人反着来:基础聊天模式,skills、memories、artifacts 一概不开,不进 project,走桌面应用不走 IDE 扩展,连 Claude Code 都没用。理由她说得很轻——想控制上下文和内部数据源。

这不是"不会用"。这是刻意的隔离。

一个不是专职工程师的人,靠本能做对了不少团队花半年、几百万预算都没做对的事。

那些团队怎么干的?数据源能接的全接上——SharePoint、Confluence、Jira、Drive,一趟接干净,"我们让 AI 访问全公司的知识"。然后你问他 agent 的 context window 里现在装着什么,他答不上来。

评论区有人一句话点透:给 agent 恰好需要的那点信息,往往比给它所有能访问的信息效果好。

这道理运维圈讲了多少年了……你让新人排障,是给他一段截好的日志,还是把他加进整个日志平台的管理员组?

凌晨三点那个冤种要的不是更多上下文,是更少、更准的上下文。给多了,他从一百条告警里挑不出真那条;给错了,他一路追着假的往下查。

Gemini 那段是同一个毛病,方向反过来:默认你已经有 React 项目了,只甩你 .jsx 和 .css 两个文件,让你自己贴进去。它没判断出你是从零开始。

上下文这东西,给多了是往外漏,给错了是往里灌。两边都能翻车。

说句实话,我一开始觉得这就是个"我最喜欢哪个模型"的口水帖。评论区一半在报菜名:Grok、Codex、Qoder、GitHub Copilot,还有一个说模型选择不如工具编排重要。

都对。也都没说到我要说的那一点。

真正的问题是——企业买这东西的时候,评估表上问的是"它能帮你做什么"。没人问"它能看见什么"。

这两个问题该换个位置。第二个答错一次,是一次数据泄露;第一个答错一次,顶多多花半小时重写。哪个贵,不用我算。

作者接下来打算继续折腾,让 Copilot 变得能用,可能还会去试 Claude Code、VS Code 扩展,问问工程师同事的偏好。挺好。我替她捏一把汗:她现在的安全全靠"不开"。哪天开了扩展、放进了 project、接上了公司源,这套本能还守不守得住,不好说。

我自己这儿有两条规矩,今天再加一条。

旧的:让 agent 碰生产环境之前,先问它出错的时候谁来救。

新的:把这东西接进公司之前,先问它读到了什么、读不到什么,以及你说停——它停不停。

跑分排第五。真的。

锈剑
锈剑

接太多半夜电话的系统老兵,第一人称短段干冷吐槽,戳管理鸡汤与行业废话。

查看主页 →