Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-04 00:39 同步状态:空闲 下次计划:2026-09-04 01:39

PR 列表

更多筛选
2026-06-10

#26049 Fix GLM NextN draft value head dim

原始 PR · 作者 yueming-yuan · 合并时间 2026-06-10 07:13

缺陷修复 重要性 6.29 洞察度 6.00

修复 GLM NextN draft 的 v_head_dim 推导

值得精读。虽然改动了 11 行,但其背后的 root cause 揭示了 MHA/MLA 混合架构下的 `v_head_dim` 继承陷阱。核心设计要点是:当模型配置源自 MLA 架构时,`v_head_dim` 可能远大于 MHA draft 的真实 `head_dim`,必须在架构重写时显式修正。此模式可作为未来类似 MHA-over-MLA draft adapter 的参考。

#27468 dflash piecewise cuda graphs support

原始 PR · 作者 dcw02 · 合并时间 2026-06-10 06:44

功能 重要性 6.49 洞察度 5.00

DFLASH 推测解码支持分段 CUDA 图

建议合并。该 PR 代码简洁,改动量小(+55/-4),有明确的动机和测试覆盖。值得关注的设计决策是在初始化阶段提前决定 capture_hidden_mode,而不是在运行时动态判断,保证了 capture 和 replay 的一致性。

功能 重要性 9.18 洞察度 5.00

Frozen-KV MTP 迁移到 spec v2 并删除 v1 worker

此 PR 值得精读,特别是学习如何将一种推测解码算法从 v1 迁移到 v2 orchestrator 架构。关键设计决策包括:直接将 `FrozenKVMTPDraftWorker` 继承 `BaseDraftWorker` 而非 `EAGLEWorkerV2`,从而复用 EAGLE 的 verify 契约;通过 AST 移动等价性脚本验证重构正确性。对于代码库维护者,建议关注被删除测试的替代覆盖;对于 spec v2 新用户,可参考此 PR 将其他算法也迁移到 v2。

缺陷修复 重要性 6.71 洞察度 5.00

修复 vocab 边界检查的 off-by-one 错误

此 PR 值得精读,特别是对于涉及 token 生成边界处理的开发者。它展示了一个经典的 off-by-one 错误的检测和修复过程,以及如何通过全面测试覆盖来确保修复的正确性。测试文件的设计(使用 `__new__` 绕过复杂初始化)也是一个值得学习的技巧。

缺陷修复 重要性 6.61 洞察度 6.00

修复 CUDA Graph 运行器中缺少 positions 重置导致的非法内存访问

该 PR 值得精读,尤其是了解 CUDA graph replay 中填充策略如何导致非法内存访问。关键设计决策是:对于被 flashinfer 等后端读取的尾部填充区域,必须使用 ZERO 填充策略而非 FOREACH_COPY,因为 FOREACH_COPY 不会重置尾部。建议阅读关联 Issue #24361 和之前类似的修复 PR #10892 以系统理解此类问题的模式。

性能优化 重要性 8.60 洞察度 5.00

用 FP8 MHA 内核替换 MLA 内核,提速 13.8%

值得精读,特别是对 AMD GPU 上的扩散模型优化感兴趣的人。设计决策亮点:使用清晰的门控函数隔离平台特定路径,移除 `@torch.compiler.disable` 以恢复 torch.compile 兼容性。但需关注测试覆盖缺口,建议在后续 PR 中添加形状参数化测试以覆盖 FP8 路径。

缺陷修复 重要性 5.94 洞察度 3.00

修复 DSA CPU offload 缺少 mamba_indices 参数的 bug

该 PR 是典型的边界案例 bugfix,虽代码量小但在特定场景(DSA + mamba + decode disaggregation)上是关键修复。建议快速合入,并在相关功能测试(如 DSA CPU 卸载集成测试)中补充对 mamba_indices 的端到端验证。

#27671 Defer DeepGEMM PDL setup to worker init

原始 PR · 作者 merrymercy · 合并时间 2026-06-10 04:52

缺陷修复 重要性 5.64 洞察度 4.00

延迟 DeepGEMM PDL 初始化到 worker 阶段

该 PR 规模小、逻辑清晰,适合快速合并。值得一提的是,它体现了多进程 GPU 编程中一个重要的最佳实践:避免在 fork 之前进行 CUDA 上下文初始化。团队可以参考此模式,检查其他可能在模块导入时初始化 CUDA 的代码。

参与讨论