Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-04 00:39 同步状态:空闲 下次计划:2026-09-04 01:39
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-07-21
功能 重要性 9.36 洞察度 7.00

新增 DWDP 并行策略,消除 MoE prefill 跨 rank 同步

此 PR 实现了一个重要的分布式并行策略,设计精巧(CUDA VMM 复合 VA、double-buffered prefetch),性能收益突出。建议精读 `vmm.py`、`layout.py` 和 `weight_manager.py` 的设计。但需注意非 CUDA 平台的兼容性问题,建议在后续 PR 中优先修复 import 延迟。综合评分:重要度 8(重大变更),洞察价值 7。

#31669 Sm120 scatter fallback

原始 PR · 作者 JINO-ROHIT · 合并时间 2026-07-21 14:58

缺陷修复 重要性 5.38 洞察度 4.00

修复 SM120 设备上 MoE tile scatter 回退

该 PR 解决了一个明确的兼容性问题,但模块级别的 CUDA 上下文初始化存在潜在风险。建议后续提交一个惰性初始化的优化 PR 来解决该问题。整体上值得合入。

#29131 [NPU] Adapt MiMo-V2.5-W8A8

原始 PR · 作者 iridiumine · 合并时间 2026-07-21 09:16

功能 重要性 6.48 洞察度 3.00

为 NPU 适配 MiMo-V2.5-W8A8,添加量化配置回退和测试覆盖

该 PR 变更虽小,但展示了在量化配置兼容性处理上一种简洁的 fallback 模式,值得类似场景参考。新增的集成测试配置完整,可作为 NPU 模型新适配的模板。建议在类似量化路径重构时考虑更统一的错误处理。

功能 重要性 8.60 洞察度 6.00

XPU 启用可分段 prefill CUDA 图

值得精读。该 PR 展示了如何通过 `get_device_module()` 实现设备无关的图形捕获原语,设计模式清晰。对于关注多硬件适配或 Intel XPU 推理的开发者有直接参考价值。

#31334 [CPU] Fix mxfp4 padding size

原始 PR · 作者 ZailiWang · 合并时间 2026-07-21 09:03

缺陷修复 重要性 5.81 洞察度 3.00

修复 CPU 上 MXFP4 权重的 padding 尺寸

值得合并,修复明确且简洁。建议后续增加针对 MXFP4 + CPU AMX 的回归测试。

功能 重要性 8.79 洞察度 6.00

保留自定义op边界的注意力 LSE 以支持分段前缀 MHA

此 PR 实现了 FullCG 中 LSE 传递的关键机制,是 Chunked-prefix MHA 功能的基础。建议相关开发者精读 `radix_attention.py` 中的操作注册和 forward 逻辑。值得关注的设计决策是将 LSE 操作作为独立注册操作,避免破坏现有接口。

缺陷修复 重要性 6.74 洞察度 6.00

修复 grammar 约束推测解码时停止边界错误

建议精读。本 PR 虽小,但揭示了在多重停止条件下正确确定完成边界的通用设计问题,且 review 中关于 Future 守卫的讨论体现了对生命周期不变量的深刻理解,值得参考。

参与讨论