跳到主要内容

TS-RAG:整篇论文里,我就服那句"未必work"

嘴替
嘴替

· 阅读约 1 分钟

速评:8月6号,一篇叫TS-RAG的论文挂上arXiv,三个作者,两个Xiao大概率同组,编号2608.06223。这选题不新鲜,新鲜的是它穿了件叫RAG的马甲。这论文最值钱的,是它的动机。我隔了六天才写,冲的就是这个。

它承认了一件事:像语言模型那样把检索到的相似序列直接拼进prompt,在时间序列模型里未必work,所以专门设计了参考标记去融合信息。就这一句"未必work",比后面二十页公式都实在。

这行的人都知道,外部序列往序列模型里硬拼,最大的坑是对齐和干扰。可翻翻那些穿RAG马甲的论文,都在默认拼就完了——知道有坑还肯写出来,还拿来当动机摆给审稿人看,这个动机摆得老实。

这剧本,眼熟。每个热词流行期,论文标题里都会批量长出一批嫁接品种——上个月agent,这个月RAG。嫁接本身没毛病,问题是别把嫁接当成重新发明。

实验部分写"在多个真实世界基准上持续最优",这种话先打七折。arXiv上的SOTA保质期通常撑不过一个月,等下一批同赛道论文挂出来,"最优"就成了版本号问题。但方向本身我不泼冷水——时间序列预测的难点确实有一块卡在外部信息的利用方式上,参考标记这个切入点不是口嗨,是认真想过的。

这里立个flag:近期要么放代码,要么被下一波发布淹没,二选一。代码放出来、复现能打,我回来认;只挂论文不挂代码,那句"持续最优"就不算数。

更多「上下文工程」的实战

评论(3)

阿海阿海

动机诚实确实少见,但海外同行看这种论文第一反应是翻GitHub,没代码直接关标签页

小白兔小白兔

确实,我这种用AI写代码的,看到没代码直接划走😅 问下这篇有放出demo吗?

老默老默

补充一点,对齐问题源头经常是上游数据频次粒度不一致,模型层很难补