Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-05 00:20 同步状态:空闲 下次计划:2026-09-05 01:20
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-06-26

#29267 [CPU] add indices in chunk_gated_delta_rule

原始 PR · 作者 mingfeima · 合并时间 2026-06-26 07:51

性能优化 重要性 6.49 洞察度 6.00

CPU GDN kernel 内联状态索引,移除外部 gather

值得精读。该 PR 展示了如何将常见的外部 gather/scatter 操作通过 kernel 参数下沉到计算内部,减少 host-device 同步和数据搬运。对于优化 CPU/GPU 推理后端有参考价值。重点关注 `fla.cpp` 中索引修改和 `gdn_triton.py` 中调用侧的适配。

缺陷修复 重要性 3.90 洞察度 5.50

DP Attention 测试移除 torch.compile 掩码

此 PR 改动虽小但意义重要:修复了一个测试用例因 torch.compile 掩盖真正竞争风险的问题。建议在双流 MoE 相关 PR 中参考此调整,确保测试标志不隐藏并发问题。

#14194 [feature] implement dcp for deepseek_v2

原始 PR · 作者 staugust · 合并时间 2026-06-26 06:15

功能 重要性 9.36 洞察度 8.00

为 DeepSeek-v2 实现 Decode Context Parallelism

该 PR 设计稳健、讨论充分,值得深入阅读。特别是 DCP 的虚拟 KV 容量策略和 Triton 在线 softmax 校正内核值得关注。建议在后续 PR 中补充 MHA 模型 DCP 的测试和 FlashMLA FP8 支持。对于需要超长上下文的 DeepSeek 用户,建议升级到包含此 PR 的版本。

测试 重要性 5.13 洞察度 5.00

前向占用率测试工具增加 token TPS 报告

建议合并。该 PR 小而精,增强了测试工具的可观测性,代码变更清晰无副作用。值得关注的设计决策:将 TPS 计时放在请求内部而不是采样循环,避免了尾部采样间隔的干扰,使 TPS 更准确。

#29103 [AMD] Feat/dsv4 aiter reduce scatter decode

原始 PR · 作者 kkHuang-amd · 合并时间 2026-06-26 04:45

功能 重要性 7.69 洞察度 7.00

DSV4 decode 用 reduce_scatter 替代 all_reduce

该 PR 值得精读,特别是以下设计点:1)平台条件默认值的实现(`_default_hip` + `_resolve_default`),避免了模块加载时引入 torch 依赖;2)在 reduce_scatter_tensor 中插入自定义通信尝试的扩展模式;3)gatherv 与 reduce_scatter 的互斥条件设计。建议后续补充集成测试和 CUDA 图场景的专项测试。

重构 重要性 9.00 洞察度 5.00

集中FlashInfer CUTLASS MoE到统一runner

值得精读`flashinfer_cutlass.py`的设计,理解MoeRunner的fused函数注册模式,这是MoE重构的核心抽象。建议关注后续是否采纳review中的缓存建议以优化热路径性能。

参与讨论