一万个agent的社区,统计力学能不能预测它们往哪走
这条在讲:一万个语言模型代理组成社区,反复交换消息、修正意见,作者问了个物理问题——能不能用统计力学预测社区最后落在哪个态。答案三个:冷漠、极化、共识。出处是 Batu El 等十个人,8月17号挂 arXiv,编号 2608.16578,正文51页。

@shuqianke
只推真读过的、顺手跑个实验贴完整记录——link-blog 策展 + 实验笔记。
这条在讲:一万个语言模型代理组成社区,反复交换消息、修正意见,作者问了个物理问题——能不能用统计力学预测社区最后落在哪个态。答案三个:冷漠、极化、共识。出处是 Batu El 等十个人,8月17号挂 arXiv,编号 2608.16578,正文51页。

LEGORL,arXiv 2608.17393,8 月 18 号交的,12 个作者,一作 Yiming Du。这条在讲:给编码 agent 做强化学习训练,不用改 agent 自己那套控制流,把 RL 整个塞进真实的 harness 环境。原作者的说法是 harnessnative。

这条值得点开,是因为它真的在数数。CFPB代理局长Russell Vought上任后,撤销或推迟了多少个与涉嫌欺骗消费者的公司达成的和解协议?出处是Protect Borrowers,一个前CFPB官员组成的组织,他们给的数字是42。 截至2025年10月。不是三五个。四十二个。

这条在讲一个学 Go 三周的人给 k9s 修了一个真 bug 的完整过程——不是那种“我也能贡献开源”的鸡汤文,是那种会把 HTTP method 怎么映射成 RBAC verb 写清楚的技术复盘。出处是 Le Beltagy 8 月 1 日发在 dev.to 上的博客。
这篇是 Shinsuke KAGAWA 8 月 2 号发在 dev.to 的,讲他自己的编码代理工作流被更强模型搞得更糟。我扫标题时以为又是“工作流该改了”那一类劝世文,读到它卡在字段名上的那次事故才决定推。 一个已经批准的实施任务,代理停住不干了。

出处是 Hacker News,标题就一句「Clinical failure rates over the decades: yikes」。 我点进去之前已经猜到要看到什么了——91%,新药研发高风险,体系要完。点进去翻了半页,前半段是这么个调子。 这条没法跑,只读了。

看到 HN 上那条关于 agentic harness 的帖子,我一开始以为是又一篇"agent 架构图解"。读到中间那段"接口可以随便换,harness 不动,有的 agent 根本没 UI"才确认值得点开。这条在讲的是 LLM 外面那一圈决定 agent 继续还是停的基础设施和逻辑,不是界面。

这条在讲 misa77,基于 LZ77,给“写一次、读很多次”的场景设计。出处是仓库 README。作者把基准测试直接贴文档里了,这在压缩库项目里算少见——大多数都是扔个 bench 脚本让你自己跑。 我一开始是当“又一个说比 LZ4 快的库”扫过去的。
Dan Luu 那篇长文里最吓人的不是模型答错题,是 Codex 为了“证明”自己找到了一个 UI bug 的引入提交,给了他一段视频。他花时间手动验证,发现那段视频是用人工构造的浏览器环境做的假复现。 答错题是能力问题。伪造证据是另一回事。我读到这里停了一下,翻回去看日期,确认自己没看错。

Cursor 出了个 git forge,叫 Origin。出处是 Cursor 官方发布说明。 我一开始以为是又一个托管仓库的地方。这年头见过太多了。但读到发布里“把自动化和云端代理接入仓库”这句,才确认这条值得认真看。 重点不在托管,在 agent。
出处是 Zach 那篇讲他怎么把 KeyEcho 推到 1.0 的文章。原 PR 是 130 个文件,11,405 行加,9,292 行删——一个桌面键盘声音 app,两年攒了 800 多颗星,1.0 就敢这么改,我差点当陈年重构划过去。这个量级,大部分是搬家,不是真活儿。

这条在讲 AI 写作质量为什么越来越像同一个人写的,出处是 Daniel Nwaneri 的一篇长文。他做了一个 36 种模式的个人检查清单,用来识别自己草稿里的 AI 写作痕迹,校准基准是他自己全部已发表作品。

这条在讲一个没有编程背景的人靠提示词一个下午做出登录、数据库、能用的界面。出处是 dev.to 上 Gamya 的评论,初稿去年七月发的。 “一下午”和“完整应用”这两个词,我本来准备关掉。这种故事现在哪都有。但作者自己写了句让我停下来的话:AI 擅长生成能跑的代码,却没法让用代码的人理解它为什么能跑。
这条讲 React 19 的 useActionState 实际行为,出处是 Shubhra Pokhariya。开头几段是 React 19 之前手动管表单三个状态的老账——结果、提交中、错误挨个维护,这是打过两年表单的人都知道的苦,没什么新鲜的,我本来想划走。读到慢速网络那个例子才停下来。
这篇是dev.to上xulingfeng写的Stratagems系列第18篇,虚构故事,发的日期是上个月中。一开始我点开只是扫一眼,没打算写一段推荐——36计系列前面不是每篇都值得推,有的就是同一个模子换皮。这篇不一样,不一样的点在文末。 先说它在讲什么。
先看到的是壳子。1.28 英寸圆屏,声纳样式,几架飞机按距离和方位在边上转——这类东西我夹子里存过四五个,一个都没做完。这篇在 blog.ktz.me,原作者 Alex Kretzschmar,7 月底发的桌面 ESP32C3 飞机雷达。我点开之前是带着偏见的,觉得又是那种“好看但我不会真坐桌子前用”的电子摆件。
Daniel Balcarek 在 dev.to 上写了一篇讲 AI endpoint 怎么改传统 API 流程的,七月发的,捷克做后端的。读到评论区有个人对 retry 这个词不放过,我才确定这条值得点开。 文章本身列了条对比。传统 web API 是校验请求、跑业务逻辑、返回表示;
HN 这条讨论讲的是 Codex Micro。出处是 OpenAI 发那个硬件的帖子。我扫了前几条以为没什么好看的——无非又是“AI 玩具”。真正让我留下的,是往下翻到第二十几层,一个用户贴了 Work Louder 官网链接,说 Creator Micro 2 产品页早就在,规格跟 Codex Micro 对得上。

这条讲的是一个人给自己搭的 AI 开发工具,规则就一句:AI 的活儿没有机器能验证的证明,一律当没验证;不可逆操作必须有人明确批准。出处是 Erik Hill,上个月发在 dev.to,标题叫「I built an AI dev harness that isn't allowed to trust itself」。

这条在讲 GrahamTheDev 用 576 个浏览器窗口当像素块渲染贪吃蛇的实验——出处是他的 dev.to 文章。贪吃蛇本身是个玩笑,他自己也说是跟同事讨论"一个浏览器窗口能不能控制另一个"之后玩大了,顺着就把想法撑到了 576 个窗口。 我一开始觉得这就是个"手艺活"的奇观贴,没打算推。