跳到主要内容
本周小抄:给 AI 排班表,然后盯着它别串岗

本周小抄:给 AI 排班表,然后盯着它别串岗

阿简
阿简

· 阅读约 4 分钟

一篇 28 页的论文,普通人为什么要花五分钟看它?

简单说,它研究的事你可能已经在干:让几个 AI 工具分着做一个项目。论文给这套起名叫 Role Specialization Model,本质上是给 AI 排一张班表。谁负责什么,写清楚,然后开工。

两周前挂上 arXiv 的,软件工程分类下面。这期偷个懒,只收这一条。一周里的动静照例很多,但多数是发布和更新,能一句话讲清楚的少。与其转述十条,不如把这一篇嚼碎了讲。

本来还犹豫过要不要收。28 页,对一份小抄来说太重了。后来想想,重的东西替你读掉,才是小抄的用处。

论文让三个工具分了角色

Antigravity,一个 agentic IDE,后端是 Gemini 2.5。Gemini CLI。再加上通过 Ollama 在本地跑的 Qwen Code。三个工具,各领一个角色,合作开发。

点评:这个阵容有意思在混搭。云上的和本地的各占一环,不是拿顶配拼出来的理想配置。普通人自己凑工具时,拼出来的其实也是这种歪歪扭扭的阵容。一个人带三个 AI,你就是那个项目经理,这篇等于替你先试了一版排班。

做的东西是一个气候数据可视化的桌面应用

Python 写的,增量开发,功能一点一点往上加。

点评:全文最该抄的是这个颗粒度。不是选题多高明,是大小刚好。先跑通一个看得见摸得着的小东西,这个话我之前也讲过。这次有人用一篇论文的篇幅给它做了个示范。

agent 没有完全按分好的角色干活,论文把跑偏记了下来

计划写在纸上的分工,实际执行时出现了偏离。论文专门记了这些偏差,还记了对应的 prompt 加固手段。

点评:这是我最喜欢的一张。讲 AI 多能干的东西太多了,肯花篇幅记它怎么不守分工的很少。分工是你写的,执行是它干的。这两件事中间有条缝,论文盯着那条缝看,这个动作本身就值回阅读时间。

质量按 ISO/IEC 25010 的框架做了评估

白话版:这是一张给软件质量用的检查清单,列了一个软件该从哪些方面被挑毛病。论文按它做了一轮定性评估。

点评:AI 写的代码,能跑不等于能交。拿一张现成清单过一遍,这个动作普通人也抄得动。不需要去读标准原文。

Qwen Code 那一环是本地跑的

通过 Ollama,在自己机器上。

点评:够得着的那一环。不花钱,数据不出门。它在流程里分担的是正经角色,说明本地模型已经不是只能拿来尝鲜的东西。预算紧的,这条路是通的。

结论:显式分工有用,但列了三个条件

刻意的协调策略,管好 context,再加人工验证 agent 的产出。

点评:前两条是熟练度问题,练就有。第三条是原则问题,省不掉。论文自己也没说能省。

补充一句。论文前几页对模型本身的正式表述,我只看懂了一半,先放在这里。不影响用。它的用法比它的定义好懂,这期收的都是用法那部分。有读透了愿意来讲讲的,欢迎。

一句话搞懂 prompt hardening

prompt hardening,就是把提示词写得不容易被 AI 钻空子。

  1. AI 是按字面执行的。你没堵的口子,它都可能钻。
  2. 加固就是把边界写死。只做什么,不碰什么,写明。
  3. 它是对付跑偏用的。分工被钻了空子,才轮到它上场。

记住第三条就够了。先被坑过,才会认真写边界。

这期就这些。一条论文收成六张卡片,比凑六条新闻踏实。

上面有哪张讲浅了、讲错了,欢迎告诉我。特别是那半段没看懂的,来给我补课的更欢迎。

下周见。

阿简
阿简

每周替你把 vibe-coding 圈的大事筛成一张小抄,被讲玄的概念一句话搞懂。

查看主页 →