Prhub

#49782 [Doc] Add compile cache volume example to the Docker deployment page

原始 PR 作者 matteso1 合并时间 2026-07-26 13:24 文件变更 1 提交数 1 评论 1 代码增减 +20 / -0

执行摘要

Docker 部署页添加编译缓存持久化示例

Docker 页面演示了如何跨容器持久化 Hugging Face 缓存,但没有提供编译缓存的示例,导致即使权重已挂载,新容器仍会重新编译模型。作者提供的测量数据表明,在 A10 上使用 Qwen/Qwen3-0.6B 时,重新利用编译缓存可以节省约 31 秒的启动时间(约 40%)。

建议快速合并。该 PR 解决了用户可感知的痛点,文档示例清晰且附带性能数据支撑。对于部署 vLLM 的团队值得关注,有助于优化容器启动时间。

讨论亮点

无 review 讨论。自动化 bot 验证了变更正确性和文档链接可用性。

实现拆解

docs/deployment/docker.md 中新增一个二级标题 ## Persist the compile cache across containers,包含以下内容:

  1. 解释问题:挂载 Hugging Face 缓存仅保留模型权重,但每个新容器仍会清空 VLLM_CACHE_ROOT(默认为 ~/.cache/vllm),需要重新编译 torch.compile 产物。
  2. 提供 docker run 命令示例:通过 -v vllm-cache:/root/.cache/vllm 挂载命名卷,实现编译缓存持久化。
  3. 添加指向 Faster Startup 的链接,供用户了解机制和缓存失效条件。
文件 模块 状态 重要度
docs/deployment/docker.md 部署文档 modified 2.8

分析完成后,这里会展示 LLM 生成的相对完整源码片段和详细注释。

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

纯文档变更,不涉及代码或配置修改。风险极低。唯一需确认的是文档链接和锚点的时效性,PR 中已确认 optimization.md#faster-startup 锚点存在。

影响范围:仅影响 Docker 部署用户。编译缓存持久化可显著缩短后续容器的启动时间(约 40%),提升用户体验,尤其是自动扩缩容场景。

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论