Prhub

#45279 docs, kv_offloading: add docs for selective offload

原始 PR 作者 ruocco 合并时间 2026-06-17 19:58 文件变更 1 提交数 1 评论 1 代码增减 +23 / -0

执行摘要

新增 per-request selective offload 文档

之前引入了 selective_offload 配置(commit 864990e8d),但缺少使用文档。本 PR 旨在补充说明和指导,帮助用户理解和使用该功能。

值得阅读,尤其是使用 KV offloading 的用户,可了解如何精细控制 per-request offload 行为。

讨论亮点

无 review 评论或讨论。

实现拆解

docs/features/kv_offloading_usage.md 文件中新增一个二级标题 "## Per-Request Selective Offload",包含以下内容:

  1. 功能解释:说明 max_offload_tokens 的作用——限制请求中可被 offload 的 token 数量,前 max_offload_tokens 个 token 被 offload,之后的 token 跳过 store 路径。
  2. 参数表格:列出键名、类型(非负 int)和说明,包括 0 表示禁用 offload,省略或设为 None 表示不设上限,非 int、负数或 bool 值会告警并视为无上限。
  3. 注意事项:使用 !!! note 提醒该功能为实验性,可能变更。
  4. 示例:提供一个 OpenAI-compatible completions 请求的 JSON 示例,展示如何设置 kv_transfer_params 中的 max_offload_tokens
文件 模块 状态 重要度
docs/features/kv_offloading_usage.md 文档 modified 3.01

分析完成后,这里会展示 LLM 生成的相对完整源码片段和详细注释。

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

纯文档变更,无技术风险。但需确保文档内容与代码实现一致,避免误导用户。

影响范围小,仅新增文档段落,帮助用户理解和使用 selective offload 功能,不涉及代码逻辑变更。

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论