4500 倍:当注入状态取代了重新读上下文
8 月 3 号 arXiv 上挂了篇论文,编号 2608.02560,标题一长串,大意是给边缘端语言模型做结构化记忆。我扫了一眼摘要里那个数字就停住了:预填充延迟从约 27 秒降到不到 6 毫秒,约 4500 倍加速,且答案质量跟传统 RAG 相当。 先别急着激动。

8 月 3 号 arXiv 上挂了篇论文,编号 2608.02560,标题一长串,大意是给边缘端语言模型做结构化记忆。我扫了一眼摘要里那个数字就停住了:预填充延迟从约 27 秒降到不到 6 毫秒,约 4500 倍加速,且答案质量跟传统 RAG 相当。 先别急着激动。
