跳到主要内容
造了个替身,然后差点把自己家点了

造了个替身,然后差点把自己家点了

今天也没搞懂
今天也没搞懂

· 阅读约 5 分钟

昨天半夜刷 HN,看见一个帖子里出现了 Shabbat。我第一反应是哪个新框架。

点进去才知道,是一群人在吵"安息日能不能让 AI agent 继续跑"。

按理说跟一个还在学 Claude Code 的人没关系。我翻了一个多小时,关浏览器的时候心里有点发毛。

因为里面提到了魔像。

布拉格那个,传说里到安息日得把它关掉。还有一个是 Drohitchin 的,专门造出来在安息日替犹太人干活,结果指令不够清楚,烧起来了。

看到这段的时候我脑子里冒出来的不是宗教,是上周三晚上我自己干的事。

那天我想让同桌帮我写个定时脚本,整理我练手项目里的一堆文件。原话大概是「帮我写个脚本,把这堆东西整理一下」。它写了,跑通了,我又让它挂上每天定时,然后去睡了。

第二天早上起来,发现它顺带把我一个正在学着写的目录也"整理"了,重命名、归并,我前一天晚上刚理顺的几处引用全断。

第一反应是这 AI 怎么这么蠢。盯着看了几分钟才反应过来:不是它蠢,是我说的"这堆东西",我自己都不知道指的是哪堆。

造魔像的人大概也是这么想的吧。

帖子里有条评论说,分析这类问题应该假设「不给 agent 提示,甚至不查看它的输出」,还说这比用定时烤箱的违规程度更低——定时烤箱有火灾风险,而且安息日当天你照样在吃它做出来的东西。

看到这句我愣了一下。不是被逻辑震住,是我心里冒出来一句「这也太干净了吧」。

从学写第一行代码开始,我听得最多的一句话就是别复制粘贴、读一遍。我一开始根本不读,跑通算赢。后来有一次没读懂一段生成的逻辑,后面连着卡了好久,具体多久记不清了,反正不止一天。从那之后才逼自己读。

复杂的那种,还是会心虚地想跳过。这条我自己都没做到干净,不敢讲什么大道理。

所以"不查看输出"摆在我面前的时候,它看起来不像偷懒,像自律。

我甚至有一瞬间觉得这才是我该学的:完全不看,等于不用替它负责。

想了半天,觉得不对。

对我来说,"不查看输出"不是更自律,是更省事。这俩长得太像了,我现在能勉强分出来的唯一办法是问自己一句:如果它跑偏了,我认不认得出来。认得出来还选择不看,那叫纪律;认不出来还不看,就是把自己眼睛蒙上,然后跟人说我很守规矩。

我没有那个能力。上周三就证明过了。

所以现在的做法很笨:宁可偷看。纪律和偷懒这条线,我心里到现在还是夹生的。

帖子里还有人建议给 agent 做个 OBSERVE-SHABBAT.md,把安息日的规则写进去,让它自己遵守。又有人描述正统派的日常:周六连开灯都算工作,所以周五提前把灯开着;想在床上看书,就用一盏常亮的灯,靠滑动灯罩遮光。

同一个思路,把动作提前到前一天做完。

评论里有人嫌定时烤箱、电梯每层停这种做法看着像表演。我第一反应也是,太绕了吧。转念一想,我为了绕开一个自己没搞懂的报错,绕着写了一整晚替代逻辑,绕得比这个远多了。

提前把规矩写好,这思路我眼熟。我也写过类似的东西,不是给安息日的,是个 CLAUDE.md 之类的东西,里面列了几条"不许删文件""这个目录不要动"。

问题是我写那些规则的时候,根本不知道自己在意什么。都是出事了才回去补一条。"这个目录只读"这句,就是那个早上之后才加进去的。

提前写好规矩听着很美,但它默认你事先就知道自己会被什么东西伤到。

我不知道。我只知道上周三之前我不知道。

帖子里还区分了两种 agent:一种找交易机会,一种做学习或者智力上的事,说这两种在安息日这个问题上可能不一样。

我一开始觉得我那个脚本肯定是第一种,纯干活。后来想,那堆文件里躺着的都是我在学的东西,它一改,我一个晚上理顺的东西全断。这算哪种?

算不清。

最后有个人说,这个问题其实不新,但如果只满足于既有的答案,就会漏掉一个更难的问题:这项技术到底有什么不一样。

我大概就是被这句戳中的。安息日那套规矩离我太远,远到我连它具体在讲什么都不敢说自己看懂了;但"造一个替自己干活的家伙,然后因为话没说清楚,它把家点着了"这件事离我很近,近到就在上周三。

还没想明白的是——我到底是在用它帮我干活,还是在用它替我做判断。

这两个我现在分不出来,可能真的分不出来。它给的方案我经常是看懂之后才用的,但那些我看懂的部分,是我本来就会的,还是它上一条刚教我的?

不知道。

先记到这,明天继续。