跳到主要内容
拿海豚和鲨鱼做演示的那篇论文,让我怀疑我写的 prompt 根本不叫因果

拿海豚和鲨鱼做演示的那篇论文,让我怀疑我写的 prompt 根本不叫因果

今天也没搞懂
今天也没搞懂

· 阅读约 5 分钟

上周群里有人丢了个 arXiv 链接,2609.14985。我点开,13MB 的 PDF。

第一反应是想关掉。

后来还是拉下来了。标题里有"因果",有"虚拟世界",两个词都撞上我这周在捣鼓的那摊事。

先说清楚:我大概看懂了六成,剩下那四成里还有一半是直接跳过去的。就这样,看懂的那部分也把我这几天写 prompt 的路子掀了一下。

我这周拿 Claude Code 做一个小场景。不算正经项目,就是一个能自己往下演的小东西。prompt 大概长这样:

用户提到天气:角色叹气
用户说想回家:角色沉默两秒
用户说冷:角色关窗

我当时真觉得这就是因果了。若 A 则 B,多清楚,写下来就完事。

然后在论文里看到,他们那套东西的元规则也是"若 A 则 B"的形式。看到这儿我还得意了一下——哦,跟我也差不多嘛,就是写得比我严谨。

再往下两段就笑不出来了。

他们的 A,是用户或者智能体对这个世界推的那一下,论文里叫扰动。B 不是规则返回的东西,是这个世界被推之后最终停下来的那个位置——不动点,或者极限环。

B 不是答案,是落点。

盯着这段看了很久。心里冒出来一句「那我这周写的那堆算什么」。

拿去问同桌。它讲了一通,大意是我写的是局部规则,局部规则本身没问题,但系统整体会自己往某个平衡跑,跑到哪儿去,不一定是我那几条规则里任意一条能决定的。

大概听懂一半。剩下那一半……我也说不上是卡在哪个词上。反正就是夹生,像块没煮透的土豆。

有个证据。

前两天给那个小场景加了一条"用户说冷:角色关窗",加完之后整段对话开始围着关窗打转,关一次又关一次。我以为是模型犯傻,把那段 prompt 改短了重试,还是不行,甚至开始怀疑是不是我写的东西跟它默认的行为冲突了。

现在回头看,那个打转本身可能就是个循环。不是它犯傻,是我自己那几条规则喂出来一个它出不去的圈。

也有可能我想多了,四个字的事被我讲成这样。

我甚至有点怀疑,我看到的是不是两个层次的东西,被我用一句话糊在了一起:一个是我写下这行 prompt 这个动作,一个是这个世界自己会跑到哪儿去。要是这样,那我那几条 if-then 连"规则"都算不上,顶多是我给它画的路标。

论文里那套流程我理解得更浅:先从那个反馈模糊认知图里把元规则抽出来,元规则交给大语言模型智能体去写脚本,再让视频生成器顺着动力学的走向把脚本变成画面。写脚本用的是 Gemini 3.1,出视频用的是 Veo 3.1。

"反馈"这两个字我留意了一下。反馈意味着它会影响它自己?这个我到现在也没搞懂,就是把这个词记住了。

我连这篇该归到哪个领域都判断不了。分类栏上挂着 cs.AI,顺带还挂了 cs.CL 和 cs.IR。三个。

demo 是一个海底世界,里面有海豚和鲨鱼。九张图,论文注释里给了生成视频的入口。我还没点开,打算今天点开看看。

我看到"海豚和鲨鱼"的时候先是有点想笑。这么大的题目,这么长一篇,最后的演示是一条海豚和一条鲨鱼在海里。

然后我松了口气。

我这周一直在跟自己较劲的一件事就是:我做的这个场景太玩具了,做出来能说明什么?看到别人也是先拿玩具把整条链路跑一遍,突然觉得这不算什么事。玩具不是拿来证明什么的,是拿来先把路走通的。论文最后还提了一句这套东西能往上扩,图可以更大,智能体可以更多——这句我看懂了,而且确实是这句让我想动手试。

两个月前的我大概会觉得"若 A 则 B"就是因果的全部。现在至少知道后面还有半句,虽然那半句我还说不利索。

卡着的地方还剩几个。

一个是"瞬态反馈动力学决定元规则里因果蕴含的方向"。方向指的是什么方向?时间上的方向还是强弱上的方向?我看了三遍,还是不知道。

还有局部规则的部分性和模糊性,那段我是直接跳过去的,没看懂。

打算先做件很小的事:把我那几条 if-then 一条条拿出来盯着看,看哪些是真的"推它一下它会自己落到某个平衡",哪些其实只是我心里一个条件分支,跟因果没什么关系。

这俩的区别我现在也说不清楚。

这个是不是大家都知道啊,可能就我一个人卡在这。

评论区蹲一个大佬。谁看过这篇,或者本来就在做类似的东西,能不能跟我说说:「扰动」和我写一条 prompt,到底算不算同一件事?我心里觉得不算,但又怕是我理解反了。