一个模拟出来的利益相关者,能不能拿来练需求访谈?
有篇论文就是冲这个问题去的。69 个学生,一半跟请来的真人聊,一半跟一个基于 RAG 搭的模拟利益相关者聊。
结果分成两截。
第一截很符合直觉。学生说,真人更真实,也更有参与感。
第二截反过来了。模拟那组,提的问题质量更高,功能识别的完整度也更好。
两截摆一起才有点意思。学生的感受和实际产出,是反着走的。
先说研究本身。
需求工程课有门老手艺。让学生去跟利益相关者做访谈,把需求一条条问出来。教起来不轻松。老办法是角色扮演,毛病是费人费时间。得约人,得给人讲背景,一个班几十号人轮不过来。
用大模型演,理论上能解决这个。但论文点了两个毛病:幻觉,回答前后不一致。
后面那个对访谈训练更致命。访谈是连着聊的。你上一句说自己是财务,下一句变成运维,学生当场出戏,这轮练习基本废掉。
RAG 治的就是这个。回答不从模型脑子里现编,先从检索到的材料里捞,再组织成人话。实现用的是 LangChain。
论文 9 月 11 日挂到 arXiv,28 页,软件工程方向。期刊版更早,已经发在 Requirements Engineering 上。所以严格说不算新闻,是我这个月翻到的。
值得看的点在哪?
不在"AI 能不能演人"。那个答案早就是能了。值得看的是那两截结果的分裂。
"真实感"是最容易骗人的一个评价维度。真人会跑题、会冷场、会答得含糊,会反问你一句你答不上来的话。这些恰恰让学生觉得,对,这是真人。模拟的那个稳定、有问必答、答得也全,学生的感受反而是"假"。
问题是,这个"假"的感觉,跟这轮训练要练的东西,关系不大。
访谈训练练的是把需求问清楚、问全。这一点上模拟反而更好。原因不神秘:模拟不会累。你问得烂,它照样答;你多问几轮,它多答几轮。真人被问烦了,是真的会烦。
这里我想到一个反例,先摆出来。
真人组提的问题质量差一点,也许不全是能力问题。真人的价值恰恰在于不可预测。学生从真人那边要应付的是意外,模拟那边没有意外,任务本身就简单了一档。真是这样,"问题质量更高"就不说明模拟更好,只说明它更可控。
谁评的问题质量、按什么标准评的,摘要级别的信息看不出来。这条我不确定,先放在这里。
还有一点得自己给自己泼冷水。一个班 69 人,单次对照实验,样本不算大。结论别外推得太狠。它说明的是"在这门课的这次练习里"。
不过有一点我敢说:一门课的目的是练手,那"练到了没有"应该比"练得像不像"重要。真人资源不够的时候,模拟不是凑合,是另一个选项。
拐一下,说普通人。
这套结果跟普通人挑 AI 工具踩的坑是一回事。
大多数人判断一个工具好不好,靠手感。回得快不快,语气顺不顺,界面顺不顺眼。这些不算错,但跟"它替你做出来的东西对不对"是两码事。手感好、产出烂的工具多得是。
所以挑的时候别拿"我感觉它挺好"当验收标准。给自己定一个能被验证的产出。脚本跑没跑通,页面能不能打开,这份需求里有没有漏掉一个功能。跑通了算数,感觉不算数。
同理,需求没问清就上手写代码,是最常见的一种翻车。工具再强也救不回来。论文讲的是教育,但那个坑,干活的人一样会踩。
拿 AI 练软技能也是一个道理。面试、客户沟通,都能找个模拟对象对练。验收的时候还是看产出,别看聊得爽不爽。
老实说,这篇我只看懂七成。检索那部分没细看,怎么建库、怎么压住回答前后不一致,我还没吃透。等我搞明白再补一句。有兴趣的自己读原文,读完愿意回来给我讲讲怎么建库的,更欢迎。
本周就这些。上面有任何一条你试过、或者觉得我讲错了,欢迎告诉我。
下周见。