Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-05 00:20 同步状态:空闲 下次计划:2026-09-05 01:20

PR 列表

更多筛选
2026-06-02
文档 重要性 4.12 洞察度 2.00

更新 IB 设备格式的文档与 CLI 帮助

此 PR 是典型的功能文档补全,建议阅读以了解 PD 分解中 IB 设备配置的三种格式。但需注意文档可能超前于实现,建议结合关联 PR #26114 一并审查验证逻辑是否已适配。

性能优化 重要性 7.48 洞察度 6.00

PP 并行 DeepGEMM JIT 编译显著缩短启动时间

该 PR 设计清晰、讨论充分,值得精读。重点关注: - 如何将 PP 串行编译变为并行:利用 `kernel_warmup` 在每个 rank 独立执行 dummy forward。 - Batch size 的推导方法:基于 GPU SM 数和 block_m 的启发式,覆盖 n_splits 范围。 - 对 `_dummy_run` 的重构:引入 `forward_mode_override`,使生成模型也能触发 EXTEND 路径,并修复了原逻辑对 `is_generation` 的依赖。 - 兼容 PD 分解和 DSA prefill CP 的细节处理。

功能 重要性 7.71 洞察度 5.00

启用FlashInfer GDN MTP验证于SM100+

建议关注 gdn_flashinfer.py 中 _mtp_bf16_adapted 函数的适配技巧(中间状态切片、A_log float 转换),以及测试文件如何通过抽取公共参数和工具函数降低重复代码。该 PR 设计简洁,适合作为跨硬件后端子类化的参考案例。

基础设施 重要性 3.50 洞察度 2.00

手动全量 CI 运行启用完整并行度

该 PR 是小而有效的 CI 改进,建议合并。对于 CI 维护者,该逻辑值得参考,作为扩展 CI 并行度控制的模式。

缺陷修复 重要性 7.22 洞察度 4.00

回退 spec v2 topk>1 树形 draft 支持,修复默认行为破坏

阅读者应关注此 revert 背后的测试覆盖率不足问题:原始 PR #26866 的 CI 状态为 ❌,仍被合并,导致默认行为破坏。建议加强 speculative 模块的自动化测试,特别是 topk>1 与 spec v2 的组合场景。回退本身逻辑清晰,值得参考的是 `fill_bonus_tokens` stride 参数的修正——用 `accept_index.shape[1]` 而非 `speculative_num_draft_tokens` 是导致 topk>1 错误的根本原因之一。

#23179 [LoRA] add lora chunked req test and fix

原始 PR · 作者 glenliu21 · 合并时间 2026-06-02 07:25

缺陷修复 重要性 4.58 洞察度 3.00

修复 LoRA 分块请求槽位遗漏

值得阅读以了解 LoRA 调度中的分块请求处理陷阱。虽然代码改动极小,但反映了状态同步容易遗漏的典型场景。

参与讨论