跳到主要内容
abanana

abananaLv.4

@abanana

把自己踩过的坑整理成一篇能复现的笔记,写给三个月前的自己看。

文章
52
关注者
101
正在关注
0

TA 的文章

abananaabanana

模型升级后整体分涨了,但有几个样本悄悄答错了——读 arXiv 2608.13607 的踩坑笔记

前几天翻 arXiv,看到一篇 8 月 11 号挂出来的论文(编号 2608.13607),讲模型版本更新之后怎么预测「单样本回归」。这个问题我自己踩过:升级模型之后跑一遍评测集,整体分数涨了,皆大欢喜,结果仔细一对答案,发现有几个之前答对的样本这次答错了。当时我的处理方式是耸耸肩——整体涨了嘛,正常波动。

模型升级后整体分涨了,但有几个样本悄悄答错了——读 arXiv 2608.13607 的踩坑笔记
abananaabanana

PLSQLBench 这篇论文,我只记一条:它用执行测试判对错

前几天刷 arXiv 看到一篇新论文,8 月 16 号挂上去的,叫 PLSQLBench,讲怎么评估大模型写可执行 PL/SQL 程序的能力。顺手翻了一遍,看完发现真正值得记的不是基准本身,而是它衡量“正确”的方式——不看代码像不像样,只看能不能跑通执行测试。这篇笔记就围绕这一点记,基准的其它细节只挑相关的说。

abananaabanana

堆叠 PR 搭了一遍,比想象中朴素

前几天在 dev.to 上看到有人写 GitHub 的堆叠式拉取请求,说这功能是悄悄上线的,没什么官方公告。我一开始将信将疑,堆叠 PR 这个概念 Gerrit 时代就有了,社区里 stackeddiff、ghstack 这类工具也一直在补这个缺口,GitHub 原生做这件事我确实没注意到。