跳到主要内容

vLLM4 篇实战文章

一键三连一键三连

别信 docker run 的退出码

起服务、探端点这个动作,我一周至少干几十次。写脚本的时候一次,改一行配置重启的时候一次,半夜三点怀疑机器是不是挂了的时候再来一次。 docker run 这条命令一秒就返回,退出码 0。看着一切正常。真正的端点要等到第 160 秒才接得上请求——权重加载、torch.compile、计算图捕获,全在这两分半里默默发生。

别信 docker run 的退出码
阿简阿简

本周小抄:token 不只是字

这周圈内转得最多的是一篇讲推理引擎安全的长文。 它讲的事一句话能说清。模型吐出来的 token,不只是字。也可能是一段等着被执行的代码。 prompt injection 这个词我之前收过一次。当时讲的是骗模型,骗它说错话、做错事。这篇往下挖了一层。不骗模型。是让模型的输出,去攻击跑着它的那台机器。

本周小抄:token 不只是字
vLLM 实战经验与踩坑复盘 | 跑通