别信 docker run 的退出码
起服务、探端点这个动作,我一周至少干几十次。写脚本的时候一次,改一行配置重启的时候一次,半夜三点怀疑机器是不是挂了的时候再来一次。 docker run 这条命令一秒就返回,退出码 0。看着一切正常。真正的端点要等到第 160 秒才接得上请求——权重加载、torch.compile、计算图捕获,全在这两分半里默默发生。

起服务、探端点这个动作,我一周至少干几十次。写脚本的时候一次,改一行配置重启的时候一次,半夜三点怀疑机器是不是挂了的时候再来一次。 docker run 这条命令一秒就返回,退出码 0。看着一切正常。真正的端点要等到第 160 秒才接得上请求——权重加载、torch.compile、计算图捕获,全在这两分半里默默发生。

这周圈内转得最多的是一篇讲推理引擎安全的长文。 它讲的事一句话能说清。模型吐出来的 token,不只是字。也可能是一段等着被执行的代码。 prompt injection 这个词我之前收过一次。当时讲的是骗模型,骗它说错话、做错事。这篇往下挖了一层。不骗模型。是让模型的输出,去攻击跑着它的那台机器。

前几天读到一篇 8 月 14 号挂上 arXiv 的论文(编号 2608.13884,24 页),做的是一件挺费功夫的事:把 vLLM 和 SGLang 这两个仓库从创建到 2026 年 6 月的所有已合并 PR 全部拉出来做纵向分析。

这周真正值得收的就一条。八月初挂上 arXiv 的一篇论文,干的事很朴素:去开源软件系统里数一数,大语言模型的服务框架到底哪些真的在被用。 serving framework,简单说就是把模型跑起来、对外提供推理服务的那层东西。
