Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 21:57 同步状态:空闲 下次计划:2026-09-02 22:57

PR 列表

更多筛选
2026-06-09
功能 重要性 7.09 洞察度 5.00

NPU 后端确定性推理适配

值得精读,特别是 `npu_batch_invariant_ops.py` 和 `batch_invariant_ops.py` 中的条件注册逻辑,展示了如何在 SGLang 框架中为不同硬件后端提供操作符替换。采样器中的种子化改造也是一个可重用的模式。

将 1.3MB 的 tokenizer 测试 fixture 缩小为几 KB

这个 PR 是测试基础设施的清理工作,值得所有关注仓库健康度的开发者了解。它展示了如何在不影响测试覆盖的前提下,通过细心分析测试依赖来安全地移除大型二进制/JSON 文件。

缺陷修复 重要性 5.47 洞察度 4.00

修复 FA3 EAGLE draft decode 的 page_table scatter OOB

本 PR 已合并,无需额外操作。建议开发者在涉及 FA3 后端和 speculative decoding 时,关注 #27360 的修复逻辑,并确保类似场景在其他后端也得到测试。

重构 重要性 7.01 洞察度 3.00

规范 Spec V2 代码命名,accepted→accept,page_size_1→contiguous

此 PR 是代码规范化的良好实践,值得精读以理解团队命名约定。对于关注 speculative decoding 的实现细节的工程师,重命名后的函数名更易理解其语义(accept 而非 accepted)。

性能优化 重要性 7.88 洞察度 6.00

融合 Spec 中 4 个 gather 算子,TPOT 提升 1-2%

值得精读,展示了如何用 Triton 手动融合 gather 操作绕过 torch.compile 融合限制,并附有高质量的测试设计,可作为 Triton kernel 开发的范例。

功能 重要性 9.36 洞察度 6.00

支持 DSV4 DP Attention 可断点 CUDA 图

建议所有 DeepSeek V4 相关开发者精读此 PR,重点关注: 1. `DSV4AttnMetadata.refresh_for_breakable_cuda_graph_replay_` 中的字段分类设计,这是图捕获地址稳定的核心。 2. BCG 运行器中 DP rank 同步保护的模式,可复用于其他分布式后端。 3. 注意力后端接口的扩展方式,后续为其他模型添加 BCG 支持时可参考 `DeepseekV4AttnBackend` 的 opt-in 实现。 对于运维团队,建议先在低风险预发布环境进行 A/B 性能对比,确认工作负载符合预期后再推广。

参与讨论