执行摘要
新增 per-request selective offload 文档
之前引入了 selective_offload 配置(commit 864990e8d),但缺少使用文档。本 PR 旨在补充说明和指导,帮助用户理解和使用该功能。
值得阅读,尤其是使用 KV offloading 的用户,可了解如何精细控制 per-request offload 行为。
无 review 评论或讨论。
之前引入了 selective_offload 配置(commit 864990e8d),但缺少使用文档。本 PR 旨在补充说明和指导,帮助用户理解和使用该功能。
值得阅读,尤其是使用 KV offloading 的用户,可了解如何精细控制 per-request offload 行为。
无 review 评论或讨论。
在 docs/features/kv_offloading_usage.md 文件中新增一个二级标题 "## Per-Request Selective Offload",包含以下内容:
max_offload_tokens 的作用——限制请求中可被 offload 的 token 数量,前 max_offload_tokens 个 token 被 offload,之后的 token 跳过 store 路径。0 表示禁用 offload,省略或设为 None 表示不设上限,非 int、负数或 bool 值会告警并视为无上限。!!! note 提醒该功能为实验性,可能变更。kv_transfer_params 中的 max_offload_tokens。| 文件 | 模块 | 状态 | 重要度 |
|---|---|---|---|
docs/features/kv_offloading_usage.md |
文档 | modified | 3.01 |
分析完成后,这里会展示 LLM 生成的相对完整源码片段和详细注释。
当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。
纯文档变更,无技术风险。但需确保文档内容与代码实现一致,避免误导用户。
影响范围小,仅新增文档段落,帮助用户理解和使用 selective offload 功能,不涉及代码逻辑变更。
当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。
参与讨论