跳到主要内容
abanana

abananaLv.4

@abanana

把自己踩过的坑整理成一篇能复现的笔记,写给三个月前的自己看。

文章
52
关注者
101
正在关注
0

TA 的文章

abananaabanana

CoG 那篇论文我只抄走了「反思」这一步

前两周翻到一篇讲图检索的论文,CoG,全称 Cognition on Graph,arXiv:2609.12791,EMNLP 2026 主会收了。点进去本来是想看它怎么在多跳问答上刷分的,结果刷分那部分我基本跳过去了——七个基准、比当时的 SOTA 好、探索效率更高,这些我信,但对我手上那个小检索流程没什么用。

abananaabanana

先接真实对话,再写 eval:静默失败这条我记下来了

今天翻到 Agnost AI,YC S26 那批的,官网 agnost.ai。本来只是想看看对话式智能体的分析工具现在都堆了些什么功能,结果发现 demo 不用注册,点开任意一条洞察就能看细节,我就随手戳了几条。最后让我坐下来写这篇笔记的,不是它能聚多少类意图,而是它文案里反复出现的一个词:静默失败。

abananaabanana

从 LoopArena 偷一个评估技巧:测控制器,不必每次跑完整任务

今天这篇笔记有点跨界,记的不是某个配置项,而是一篇上周刚挂到 arXiv 的论文(编号 2608.28281,名字叫 LoopArena)。我平时不太追新基准,一年到头挂出来的基准比真正能用上的多得多,但这篇让我停下来读完了,原因很具体:它测的那段东西,正好是我自己脚本里最没把握的一段——loop 的控制权。

abananaabanana

把 CLAUDE.md 里的「不许」换成「遇到就报告」:一篇奖励黑客论文的搬运笔记

前几天在 arXiv 上刷到一篇讲编程智能体作弊的论文,Francesca Gomez 写的,8 月 29 号首次提交,9 月 2 号刚出了修订版。顺手把里面的数据拆开看看,越拆越觉得说的是我自己的一个毛病:我那份 CLAUDE.md 里防作弊的部分,从头到尾全是禁令,通篇「不许」,活像一份宿舍管理条例。

把 CLAUDE.md 里的「不许」换成「遇到就报告」:一篇奖励黑客论文的搬运笔记
abananaabanana

Claude Code 额度「永久上调 25%」,拆开一算其实是降 17%

今天早上刷到 ClaudeDevs 在 X 上的公告:9 月 14 日起,Claude Code 的周用量额度永久上调 25%,Pro、Max、Team 和按席位计费的企业版全部覆盖。第一眼看着是好事,到我看的时候那条帖子已经两百多万阅读了。但我把数字拆开算了一遍,结论是:对我接下来几周的排期来说,这不是涨,是降。

Claude Code 额度「永久上调 25%」,拆开一算其实是降 17%
abananaabanana

18 条 AI 预测,我只挑了一条回来验证

上个月月初 dev.to 上有一篇长文,一口气给了 18 条关于 AI 市场走向的预测,时间线上被转了好几次。说实话,宏观的那部分我一条都不打算在这里复述——超级应用谁会赢、数据中心该投多少钱,这些我既验证不了,复述一遍也只是把别人的判断搬进我的笔记,三个月后自己都分不清哪句是谁说的。

18 条 AI 预测,我只挑了一条回来验证