Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 21:57 同步状态:空闲 下次计划:2026-09-02 22:57

PR 列表

更多筛选
2026-08-10
功能 重要性 5.11 洞察度 3.00

XPU 启用 DSV4 片形 MoE silu_and_mul_clamp 路径

值得快速浏览,作为 Intel GPU 支持 DeepSeek V4 系列的一部分了解平台适配方式,但不必精读。核心做法是用断言放开平台限制、复用已有融合内核,设计上简洁。值得关注的点是:为什么 HIP 仍被排除、以及 XPU 上的 silu_and_mul_clamp 内核是否已通过其他途径验证;建议后续补一个 XPU 上的精度回归测试。

性能优化 重要性 6.37 洞察度 5.00

PD prefill 服务器跳过 spec verify 相关分配

值得精读,尤其是理解复用 draft-head 先例实现显存优化的设计思路。建议后续补充针对 PD prefill 模式的单元测试,覆盖 pool 分配、graph 捕获和 warmup 逻辑。

缺陷修复 重要性 6.26 洞察度 6.00

修复 SM10X 上 MiniMax-M2 NVFP4 的 MoE 后端路由

值得阅读,作为“窄范围修复 + 后端决策前移”的样例。重点看两点:一是如何通过模型级 override 而非全局 fallback 控制爆炸半径;二是 review 中关于 A2A 组合与静默损坏验证的讨论,这些是同类改动容易遗漏的坑。若团队后续在 SM100 上推进 MiniMax 系列,建议先补齐 deepep 组合的显式处理与 #26324 的正确性 probe。

测试 重要性 3.37 洞察度 3.00

NPU GSM8K 精度测试重试增至 3 次并放宽超时

该 PR 值得快速浏览,不建议精读——它只涉及测试工具与 CI 配置,无运行时逻辑。值得关注的设计点是:用全局 `MAX_RETRY_COUNT` 取代各测试基类的 `max_attempts` 属性,是"单一事实来源"的合理收敛;但 `DATASET_FLUCTUATION` 与 `DATASET_QUESTION_COUNTS` 不同步登记 `gsm8k` 的问题需要后续跟进,否则新增配置形同虚设。对负责 NPU/CI 稳定性的同学,建议顺带检查 `get_max_retries` 的完整实现,确认 GSM8K 重试确实达到 3。

性能优化 重要性 5.49 洞察度 6.00

c128 核 epilogue 改 2 warp 写回,提速 5%~10%

值得精读,尤其面向 kernel 工程师:① “最少参与 warp 数 + 寄存器折叠”的 epilogue 设计思路可迁移到其他归约密集型核;② 常量收敛为 Config / Trait 的写法是 JIT 多核共存的良好实践;③ 三次 rebase 合流评论是长生命周期内核 PR 如何与 dtype 重构共存的实例。注意点:合入时 CI 并非全绿、且无新增持久化测试,若要在生产环境依赖该 kernel,建议先自行跑 test_c128_v2.py 与 DSV4 精度回归再升级。

缺陷修复 重要性 5.21 洞察度 8.00

修复 DSV4 top-k 在 CUDA 13.1+ 丢非 primary rank 输出

值得精读。这是少见的“工具链版本敏感型编译器错误”调试案例:作者系统排除 9 类假设、用 slot-diff 与插桩把根因定位到单一指针变量携带两个地址空间,方法论本身有很高的迁移价值;`__builtin_assume` 作为 load-bearing 约束而非优化提示的用法也值得记录。建议阅读时重点关注 topk_impl.cuh 中两条散射路径的拆分注释、topk_v2.cuh 中 `__builtin_assume` 的依赖说明,以及 v1 模块 `STB_GNU_UNIQUE` 符号合并的分析。后续可跟进 sm_100a 运行时验证与 CI nvcc 版本保护。

性能优化 重要性 6.78 洞察度 4.00

speed 模式默认关闭 torch.compile,改为模型 opt-in

值得精读,尤其适合 diffusion 服务维护者。该 PR 是一个小体量但影响全局默认策略的变更:以 E2E 数据推翻「speed 即 compile」的直觉假设,并保留三层优先级(显式参数 > 模型部署配置 > 全局默认)。建议关注 `adjust_based_on_performance_mode` 中「模型 opt-in 且用户未显式传参」的生效条件,以及后续模型逐渐补齐 opt-in 的演进方向。

缺陷修复 重要性 6.99 洞察度 5.00

修复 DCP prefill 的 GQA 映射错乱,GSM8K 恢复至 0.95

值得精读。重点关注 `_forward_extend_dcp` 中 K/V 切片公式的简洁推导(`rank_in_group * tp_k_head_num // world_size` 配合 `max(..., start + 1)` 防空切片),以及 CPU 回归测试用 `FakeDcpGroup` + fake `extend_attention_fwd` 固定“无通信、形状正确、选区正确”三个契约的轻量测试模式。该 PR 也提供了一个很好的静默正确性回归修复范例:作者用精确的精度数据(0.77 vs 0.95)证明 bug、用 DCP1 对照证明无回归、用 TP8/DCP2 扩展拓扑覆盖。

参与讨论