#27721 Add TP server GPU process regression test
原始 PR · 作者 merrymercy · 合并时间 2026-06-10 07:25
新增 TP 服务进程 GPU 上下文回归测试
建议精读此测试的实现思路,特别是 `_wait_for_server_gpu_processes` 中的稳定等待策略以及如何利用进程树过滤 GPU 进程;该模式可用于其他与 GPU 资源分配相关的回归测试。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 merrymercy · 合并时间 2026-06-10 07:25
新增 TP 服务进程 GPU 上下文回归测试
建议精读此测试的实现思路,特别是 `_wait_for_server_gpu_processes` 中的稳定等待策略以及如何利用进程树过滤 GPU 进程;该模式可用于其他与 GPU 资源分配相关的回归测试。
原始 PR · 作者 yueming-yuan · 合并时间 2026-06-10 07:13
修复 GLM NextN draft 的 v_head_dim 推导
值得精读。虽然改动了 11 行,但其背后的 root cause 揭示了 MHA/MLA 混合架构下的 `v_head_dim` 继承陷阱。核心设计要点是:当模型配置源自 MLA 架构时,`v_head_dim` 可能远大于 MHA draft 的真实 `head_dim`,必须在架构重写时显式修正。此模式可作为未来类似 MHA-over-MLA draft adapter 的参考。
DFLASH 推测解码支持分段 CUDA 图
建议合并。该 PR 代码简洁,改动量小(+55/-4),有明确的动机和测试覆盖。值得关注的设计决策是在初始化阶段提前决定 capture_hidden_mode,而不是在运行时动态判断,保证了 capture 和 replay 的一致性。
Frozen-KV MTP 迁移到 spec v2 并删除 v1 worker
此 PR 值得精读,特别是学习如何将一种推测解码算法从 v1 迁移到 v2 orchestrator 架构。关键设计决策包括:直接将 `FrozenKVMTPDraftWorker` 继承 `BaseDraftWorker` 而非 `EAGLEWorkerV2`,从而复用 EAGLE 的 verify 契约;通过 AST 移动等价性脚本验证重构正确性。对于代码库维护者,建议关注被删除测试的替代覆盖;对于 spec v2 新用户,可参考此 PR 将其他算法也迁移到 v2。
原始 PR · 作者 Ricardo-M-L · 合并时间 2026-06-10 06:24
修复 vocab 边界检查的 off-by-one 错误
此 PR 值得精读,特别是对于涉及 token 生成边界处理的开发者。它展示了一个经典的 off-by-one 错误的检测和修复过程,以及如何通过全面测试覆盖来确保修复的正确性。测试文件的设计(使用 `__new__` 绕过复杂初始化)也是一个值得学习的技巧。
原始 PR · 作者 weizhoublue · 合并时间 2026-06-10 06:03
修复 CUDA Graph 运行器中缺少 positions 重置导致的非法内存访问
该 PR 值得精读,尤其是了解 CUDA graph replay 中填充策略如何导致非法内存访问。关键设计决策是:对于被 flashinfer 等后端读取的尾部填充区域,必须使用 ZERO 填充策略而非 FOREACH_COPY,因为 FOREACH_COPY 不会重置尾部。建议阅读关联 Issue #24361 和之前类似的修复 PR #10892 以系统理解此类问题的模式。
用 FP8 MHA 内核替换 MLA 内核,提速 13.8%
值得精读,特别是对 AMD GPU 上的扩散模型优化感兴趣的人。设计决策亮点:使用清晰的门控函数隔离平台特定路径,移除 `@torch.compiler.disable` 以恢复 torch.compile 兼容性。但需关注测试覆盖缺口,建议在后续 PR 中添加形状参数化测试以覆盖 FP8 路径。
修复 DSA CPU offload 缺少 mamba_indices 参数的 bug
该 PR 是典型的边界案例 bugfix,虽代码量小但在特定场景(DSA + mamba + decode disaggregation)上是关键修复。建议快速合入,并在相关功能测试(如 DSA CPU 卸载集成测试)中补充对 mamba_indices 的端到端验证。
参与讨论