#25521 [PD] docs: clarify disaggregation IB device formats
原始 PR · 作者 stmatengss · 合并时间 2026-06-02 11:38
更新 IB 设备格式的文档与 CLI 帮助
此 PR 是典型的功能文档补全,建议阅读以了解 PD 分解中 IB 设备配置的三种格式。但需注意文档可能超前于实现,建议结合关联 PR #26114 一并审查验证逻辑是否已适配。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 stmatengss · 合并时间 2026-06-02 11:38
更新 IB 设备格式的文档与 CLI 帮助
此 PR 是典型的功能文档补全,建议阅读以了解 PD 分解中 IB 设备配置的三种格式。但需注意文档可能超前于实现,建议结合关联 PR #26114 一并审查验证逻辑是否已适配。
原始 PR · 作者 whybeyoung · 合并时间 2026-06-02 10:51
PP 并行 DeepGEMM JIT 编译显著缩短启动时间
该 PR 设计清晰、讨论充分,值得精读。重点关注: - 如何将 PP 串行编译变为并行:利用 `kernel_warmup` 在每个 rank 独立执行 dummy forward。 - Batch size 的推导方法:基于 GPU SM 数和 block_m 的启发式,覆盖 n_splits 范围。 - 对 `_dummy_run` 的重构:引入 `forward_mode_override`,使生成模型也能触发 EXTEND 路径,并修复了原逻辑对 `is_generation` 的依赖。 - 兼容 PD 分解和 DSA prefill CP 的细节处理。
启用FlashInfer GDN MTP验证于SM100+
建议关注 gdn_flashinfer.py 中 _mtp_bf16_adapted 函数的适配技巧(中间状态切片、A_log float 转换),以及测试文件如何通过抽取公共参数和工具函数降低重复代码。该 PR 设计简洁,适合作为跨硬件后端子类化的参考案例。
禁用全量 CI 手动触发的跨任务快速失败
值得关注 CI 流程的演化,但本身技术含量低,普通工程师阅读即可。
原始 PR · 作者 prakashkagitha · 合并时间 2026-06-02 08:41
将11个旧文档页面的模型用法移植到 cookbook
值得精读,展示了大规模文档迁移的完整流程和审核实践,尤其适合需要合并整理知识库的场景。
手动全量 CI 运行启用完整并行度
该 PR 是小而有效的 CI 改进,建议合并。对于 CI 维护者,该逻辑值得参考,作为扩展 CI 并行度控制的模式。
回退 spec v2 topk>1 树形 draft 支持,修复默认行为破坏
阅读者应关注此 revert 背后的测试覆盖率不足问题:原始 PR #26866 的 CI 状态为 ❌,仍被合并,导致默认行为破坏。建议加强 speculative 模块的自动化测试,特别是 topk>1 与 spec v2 的组合场景。回退本身逻辑清晰,值得参考的是 `fill_bonus_tokens` stride 参数的修正——用 `accept_index.shape[1]` 而非 `speculative_num_draft_tokens` 是导致 topk>1 错误的根本原因之一。
修复 LoRA 分块请求槽位遗漏
值得阅读以了解 LoRA 调度中的分块请求处理陷阱。虽然代码改动极小,但反映了状态同步容易遗漏的典型场景。
参与讨论