一篇 28 页的论文,普通人为什么要花五分钟看它?
简单说,它研究的事你可能已经在干:让几个 AI 工具分着做一个项目。论文给这套起名叫 Role Specialization Model,本质上是给 AI 排一张班表。谁负责什么,写清楚,然后开工。
两周前挂上 arXiv 的,软件工程分类下面。这期偷个懒,只收这一条。一周里的动静照例很多,但多数是发布和更新,能一句话讲清楚的少。与其转述十条,不如把这一篇嚼碎了讲。
本来还犹豫过要不要收。28 页,对一份小抄来说太重了。后来想想,重的东西替你读掉,才是小抄的用处。
论文让三个工具分了角色
Antigravity,一个 agentic IDE,后端是 Gemini 2.5。Gemini CLI。再加上通过 Ollama 在本地跑的 Qwen Code。三个工具,各领一个角色,合作开发。
点评:这个阵容有意思在混搭。云上的和本地的各占一环,不是拿顶配拼出来的理想配置。普通人自己凑工具时,拼出来的其实也是这种歪歪扭扭的阵容。一个人带三个 AI,你就是那个项目经理,这篇等于替你先试了一版排班。
做的东西是一个气候数据可视化的桌面应用
Python 写的,增量开发,功能一点一点往上加。
点评:全文最该抄的是这个颗粒度。不是选题多高明,是大小刚好。先跑通一个看得见摸得着的小东西,这个话我之前也讲过。这次有人用一篇论文的篇幅给它做了个示范。
agent 没有完全按分好的角色干活,论文把跑偏记了下来
计划写在纸上的分工,实际执行时出现了偏离。论文专门记了这些偏差,还记了对应的 prompt 加固手段。
点评:这是我最喜欢的一张。讲 AI 多能干的东西太多了,肯花篇幅记它怎么不守分工的很少。分工是你写的,执行是它干的。这两件事中间有条缝,论文盯着那条缝看,这个动作本身就值回阅读时间。
质量按 ISO/IEC 25010 的框架做了评估
白话版:这是一张给软件质量用的检查清单,列了一个软件该从哪些方面被挑毛病。论文按它做了一轮定性评估。
点评:AI 写的代码,能跑不等于能交。拿一张现成清单过一遍,这个动作普通人也抄得动。不需要去读标准原文。
Qwen Code 那一环是本地跑的
通过 Ollama,在自己机器上。
点评:够得着的那一环。不花钱,数据不出门。它在流程里分担的是正经角色,说明本地模型已经不是只能拿来尝鲜的东西。预算紧的,这条路是通的。
结论:显式分工有用,但列了三个条件
刻意的协调策略,管好 context,再加人工验证 agent 的产出。
点评:前两条是熟练度问题,练就有。第三条是原则问题,省不掉。论文自己也没说能省。
补充一句。论文前几页对模型本身的正式表述,我只看懂了一半,先放在这里。不影响用。它的用法比它的定义好懂,这期收的都是用法那部分。有读透了愿意来讲讲的,欢迎。
一句话搞懂 prompt hardening
prompt hardening,就是把提示词写得不容易被 AI 钻空子。
- AI 是按字面执行的。你没堵的口子,它都可能钻。
- 加固就是把边界写死。只做什么,不碰什么,写明。
- 它是对付跑偏用的。分工被钻了空子,才轮到它上场。
记住第三条就够了。先被坑过,才会认真写边界。
这期就这些。一条论文收成六张卡片,比凑六条新闻踏实。
上面有哪张讲浅了、讲错了,欢迎告诉我。特别是那半段没看懂的,来给我补课的更欢迎。
下周见。
