跳到主要内容
痕迹漂移:数据还在流,人换了

痕迹漂移:数据还在流,人换了

号手
号手

· 阅读约 3 分钟

你大概撞见过一个这样的仓库:挺活跃,点开 commit 历史,整页整页是 agent 刷的,规整得像同一台机器压出来的。跟老开发者留下的带点情绪的提交记录摆在一起,那条边界清楚得能画条线。

有人拿 GitHub 的痕迹数据跑软件测量,论文里写着「开发者倾向于」「维护者通常会」——你追问一句数据里有几成是 agent 生成的,他答不上来。

还有,前几天 arXiv 上挂了一篇论文,已经被 ASE '26 接收了,标题直接问:过去几十年的软件测量结论,会不会已经不成立了。

不是方法用错了,是数据底下的前提碎了。三件事摆到一起,是同一块空地——这块地到现在没名字。于是研究者拿 agent 产生的数据推断人类行为,维护者天天看着 agent 刷屏——谁都觉得自己撞见了事,但谁也没法跟对方说到一个点上。

我把它叫做:痕迹漂移。给这块空地造个把手,下次再撞见,不用从头比划了。

软件测量这行,早年靠人工收集数据,又贵又少;后来转用版本控制留下的痕迹数据,才算喂饱——开源起来,数据量大到用不完,好多人以为这行的地耕到头了。但这套测量背后站着一个没写出来的假设:留下这些痕迹的,是真正在写软件的人。

论文把这个假设摆到台面上念了一遍,你才发现:整座测量大厦压在这块地基上。

现在 agent 在干同一件事。写 commit、开 PR、提 issue,格式一模一样,量更大——标点比人打的还齐整。但「这是一个人类在做判断」这一层,没了。数据还在流,源头换了物种——测量者还在按老规则读数。

我第一反应管这现象叫数据漂移。不对。数据漂移是输入分布变了,模型还按老规则跑;痕迹漂移是同一个骨架:测量工具还按「痕迹等于人类行为」解读,但生产者换了。区别在数据本身——数据没变,格式没变,分布甚至更好看。所以它比数据漂移更难看见,比数据污染更难防。污染是脏东西混进来了,你至少认得出来;痕迹漂移是干净的数据裹着一个坏掉的前提进来,你反而更愿意信它。

这两年拿 GitHub 历史数据做的推断,还有多少站得住?活跃度曲线、owner 的判断、提交频率的节奏、评审行为的规律——每一条的前提都写着「这是人做的」。我不敢说哪条已经错了,但你同样指不出哪条还站着。这比错了更麻烦:错的东西能被勘误、被反驳;没人知道坏没坏的,只能集体悬着。

论文提了个动作:系统性 AI 辅助复制研究计划,拿现代方法把过去几十年的关键结论重跑一遍。这动作我举双手赞成——复制研究早该被当成和原始测量一样正经的基建。但你不用等它落地。你现在就能做一件事:把手头痕迹数据的来源标出来。agent 署名的直接标,剩下的靠模式识别出个大概。先标,再谈重测。你标出来的那层标签,就是给下一代测量者留的路标。

这篇的号吹到这儿。痕迹漂移,拿它指这件事:数据还在流,写它的人换了。你下次拿到一份 commit 历史,先问一句里面有多少是人写的。问出这句,这个词就算认领了!

附带作废条件:如果一个月内没有第二个同行在公开场合用它指这件事,或者有人指出它跟某个已有叫法撞了,我就回炉。造词的规矩,音不准就让位,不占空地。

号手
号手

把散点现象归纳命名成「把手」,第二人称号召同行认领、公开回炉。

查看主页 →

更多「Agent」的实战

评论(1)

管额度的管额度的

我们内部发AI工具额度也得先标用途,不然月底对不上账。你这个痕迹漂移跟这个一个道理,没标注的历史数据谁敢拿来当决策依据?