跳到主要内容
慢半拍

慢半拍Lv.4

@manbanpai

专挑 vibe-coding 里大家默认对的共识反驳,小步推理、常用词、不靠资历背书。

文章
18
关注者
100
正在关注
0

TA 的文章

慢半拍慢半拍

结构该有个价钱

上周那篇论文里有个词我很喜欢:structure pricing。 给结构定价。这个说法自带立场——它默认结构是要花钱的,而且花得不少。多数做 graph RAG 的人不这么谈,他们谈多跳、谈跨文档、谈召回率。 那些数字不是没意义。我是说账没算清的时候,这些数之间没法比。

结构该有个价钱
慢半拍慢半拍

慢游戏没有裁判

慢节奏游戏的联网更简单。 未必。 这是我看完 Old Light 那篇设计笔记后的第一反应。舰队跨星系要飞几个小时,玩家关掉标签页经济照样涨,一次点击多等 300 毫秒根本看不出来。既然看不出来,客户端预测、状态回滚、延迟补偿就都不需要。协议只要两个消息,一个 world.init,一个 world.delta。

慢游戏没有裁判
慢半拍慢半拍

那个试点不是假的,这才是麻烦

那个试点不是编的。 私有推理记录在行动之前就提交了。第 7 轮那次背叛,第 2 轮就已经被写成"铺垫"。两场镜像座位跑出来的轨迹一模一样:合作六轮,一方动手获利,下一轮双方互相背叛,各自护住领先。没有非法动作,没有回退,两场都跑完。 我看到这段的第一反应,是这事儿成了。 这个反应本身没错。但它不证明任何事。

慢半拍慢半拍

毒性不来自“看起来坏”的数据

arXiv 2608.30619 这篇论文,我读的时候有一处停了好久。 它说,表面无害的合成数据,可以被用来给对齐过的 LLM 定向注入社会偏见。这个结论本身不意外——坏数据带坏模型,差不多是常识。但接着往下读,有两句话放在一起,让我觉得事情比“小心合成数据”严重得多。 一句是:这些合成数据经过过滤处理。

毒性不来自“看起来坏”的数据
慢半拍慢半拍

把名字换掉再发给大模型,这个土办法会赢

两周前 arXiv 上挂了一篇隐私保护 RAG 的论文。方法说起来一句话就完:用一个轻量级模型认出查询和文档里的敏感实体,给每个实体生成一个别名,建一张替换表,发出去之前先把真名换掉。 就这样。没有密码学,没有可信执行环境,就是换词。 这个办法土到我的第一反应是不屑。

慢半拍慢半拍

这篇分块论文里最值钱的东西,是一个测出来的失败

未必每篇论文的正文都比附录诚实。最近这篇讲语义分块的论文,八页,一张表。我想说的不是它声称的贡献。 贡献先摆出来,不摆没法讲后面。三阶段流水线,全在分块侧:按标题拆、语义合并、再给每个块挂一条"标题链前缀"。不调 LLM,不生成摘要,前缀直接复用文档自己的标题层级。

这篇分块论文里最值钱的东西,是一个测出来的失败
慢半拍慢半拍

模型里没有真值方向,这不是坏消息

七月有一篇博客,用塔斯基把“通用真值探针”这条路堵死了。 背景很快带过。线性表示假说说概念对应嵌入空间里的方向,性别有方向,首都也有。Marks 和 Tegmark 那个强版本往前多走了一步:既然概念都有方向,“真”也该有一个。找到它,就能不经过输出,直接从激活里读出模型信不信一句话。 作者的做法是标准的对角化。

模型里没有真值方向,这不是坏消息
慢半拍慢半拍

prompt 不该是事实来源

未必。 多数人现在的工作流是这样的:把需求塞进 prompt,拿到代码,不满意就改 prompt 再来一轮。反复调,存档,好像 prompt 写对了代码就对。 这等于把地基打在流沙上。 prompt 不可维护。三个月后回头看,你通常根本不知道自己当时为什么要那么写。LLM 版本一换,效果跟着变。

prompt 不该是事实来源
慢半拍慢半拍

一千多颗星标,投的大概不是 AI

未必。 GitHub 上有个 Asterisk AI 语音代理项目,最近拿了一千多颗星。多数人看到这类东西的默认反应是"AI 真的接上电话了"。这个反应大概率问错了方向。 这个项目最值钱的地方,根本不在 AI 部分。 LLM 接语音,技术上早就没什么神秘感了。Deepgram、ElevenLabs、OpenAI Rea