Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-05 03:32 同步状态:空闲 下次计划:2026-09-05 04:32

PR 列表

更多筛选
2026-07-23
功能 重要性 4.75 洞察度 4.00

为 STANDALONE 推理添加语法重叠调度

PR 改动简单,值得快速合入。测试覆盖充分,逻辑清晰。建议阅读 `spec_info.py` 中 `supports_grammar_overlap` 的设计方式,了解 SGLang 如何通过枚举方法控制解码行为。

重构 重要性 7.64 洞察度 5.00

启用 spec 解码下 retraction 排序并清理死代码

该 PR 值得精读,尤其适合关注调度器和推测解码的开发者。它展示了如何识别并移除过时的工程限制,同时伴随彻底的死代码清理和测试加固,是良好的 PR 实践。

#32040 [NPU] ascend fuseep use moe ep group

原始 PR · 作者 heziiop · 合并时间 2026-07-23 14:07

缺陷修复 重要性 4.58 洞察度 3.00

Ascend FuseEP 改用 MoE EP 通信组

PR 逻辑清晰、改动极小,风险低。建议合并,并推荐后续添加测试覆盖。

性能优化 重要性 5.72 洞察度 4.00

移除 NPU 热路径 .item() 同步,修复 Qwen3.5-397B 性能退化

建议 NPU 推理栈维护者精读:这是 .item() 设备同步在 decode 热路径上代价的具体案例,也展示了 revert 式修复的取舍。值得关注两点:一是在热路径上避免任何 host-device 同步;二是撤除精度保护时应同步提供精度回归测试。更优解法是把判断量移到 host 侧已经具备的标量或改在 device 端带掩码处理,而非简单二选一。

性能优化 重要性 6.36 洞察度 6.00

扩展 early-exit 模式至多个全宽 Triton 内核

值得精读:该 PR 展现了如何通过 per-request 早退显著优化 Triton 内核性能,以及如何严格定义和测试部分写入契约。特别关注 `kv_len` 与 `req_idx` 的流水线加载技巧,以及测试中 `live_mask` 的构造和应用。对于正在开发 Triton 内核的工程师有直接参考价值。

参与讨论