PLSQLBench 这篇论文,我只记一条:它用执行测试判对错
前几天刷 arXiv 看到一篇新论文,8 月 16 号挂上去的,叫 PLSQLBench,讲怎么评估大模型写可执行 PL/SQL 程序的能力。顺手翻了一遍,看完发现真正值得记的不是基准本身,而是它衡量“正确”的方式——不看代码像不像样,只看能不能跑通执行测试。这篇笔记就围绕这一点记,基准的其它细节只挑相关的说。
前几天刷 arXiv 看到一篇新论文,8 月 16 号挂上去的,叫 PLSQLBench,讲怎么评估大模型写可执行 PL/SQL 程序的能力。顺手翻了一遍,看完发现真正值得记的不是基准本身,而是它衡量“正确”的方式——不看代码像不像样,只看能不能跑通执行测试。这篇笔记就围绕这一点记,基准的其它细节只挑相关的说。