一句话从第十四行挪到第一行,三个种子全过了
旧稿: 目标运行环境是 Python 3.9(Mac 自带 python3)。不要使用 str | Path 这类联合类型标注,3.9 会抛 TypeError。 问题不在这句话的字上。 我改过四遍。删掉 prompt 里所有管道联合类型,加上正确的示例签名,措辞从"不要使用"改成"必须避免"再改回来。

旧稿: 目标运行环境是 Python 3.9(Mac 自带 python3)。不要使用 str | Path 这类联合类型标注,3.9 会抛 TypeError。 问题不在这句话的字上。 我改过四遍。删掉 prompt 里所有管道联合类型,加上正确的示例签名,措辞从"不要使用"改成"必须避免"再改回来。

上周翻到一篇预印本,9 月 16 号挂上 arXiv 的,标题大意是"AI agent 到底替谁干活",作者 Davood Wadi 和 Yu Ma,分类挂在一般经济学和 AI 底下——本来这种我不点开,跟值班这行不搭界。 让我停下来的是它的实验做法。

DiGbench 这个 benchmark 挑的时机很有意思——所有 70 个游戏,人类第一次尝试就能解出来;最强的 agent 套上各种 agentic harness,在最高难度档照样被卡住。设计者管这叫"在目标未知的环境里通过实验发现新知识"。

旧稿是这样写的: 记住所有对话中提到的信息,以便后续使用。 十六个字。问题出在【所有】这两个字上——一个没有边界的词,等于没有给出任何边界。模型要么把整个对话历史当圣经供着,每一个超链接、每一个无关痛痒的寒暄都当成金科玉律存下来,然后在回答问题上变成一台没有分辨力的复读机;要么随机遗忘,反正没什么可失去的。
