Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 21:09 同步状态:空闲 下次计划:2026-09-03 22:09

PR 列表

更多筛选
2026-07-07
性能优化 重要性 6.25 洞察度 5.00

XPU 跳过单专家 MoE 无意义归约

此 PR 值得阅读,特别是对于理解如何针对特定硬件(XPU)进行 MoE 内核启动优化的开发者。设计决策中体现了维持后端一致性和优化成本的平衡——作者选择与 CUDA 路径保持一致而非提前分配 `intermediate_cache3` 的激进优化,避免了过度定制化风险。同时,测试覆盖完整,可作为小型性能优化的范例。

缺陷修复 重要性 6.83 洞察度 3.00

修复 rollout 响应中 img_shapes 逐样本切片错误

值得合并,修复了明确的功能回归 bug。改动简单、安全,已获得批准。建议合并后补充一个针对 `_extract_single_sample_tensor` 的单元测试,覆盖 `img_shapes` 的 batch_size > 1 场景,以预防未来回归。

重构 重要性 8.56 洞察度 7.00

重构 CPU norm 内核为 trait 框架,新增 fused_qk_gemma_norm

值得精读。本 PR 展示了 C++ 模板元编程在 SIMD 内核库中的典型应用,利用 NormTraits 和 NormReduce 实现零开销抽象。对于计划在 sgl-kernel 中添加新 norm 变体的开发者,框架设计模式有直接参考价值,建议重点阅读 NormParams 和 NormReduce 的实现。

缺陷修复 重要性 7.96 洞察度 6.00

修复Ernie-Image动态批处理变长标题精度错误

值得精读。PR展示了如何系统性地修复动态批处理中变长输入的精度问题,包括正确的mask传递模式(从postprocess到cond kwargs再到attention layer)。同时,作者通过逐步提交和revert管理风险的做法值得借鉴。重点关注`_prepare_encoder_hidden_states_mask`的设计(均匀长度返回None)以及`build_varlen_mask_meta`在DiT中的使用。

缺陷修复 重要性 6.47 洞察度 5.00

修复 NIXL 连接器解耦推测解码 KV 长度不匹配

建议精读:展示了如何在不破坏现有架构的前提下,通过长度切片优雅解决数据不对称问题,并显式禁止未测试路径。值得关注的决策在于对 HiSparse + decode-only spec-dec 组合的保守处理。

#29331 [NPU] Add new diffusion tests

原始 PR · 作者 e-martirosian · 合并时间 2026-07-07 05:40

测试 重要性 5.94 洞察度 4.00

为 NPU 扩散模型新增 7 个测试用例与性能基线

建议合并此 PR,但后续应关注 `perf_baselines_npu.json` 的基线稳定性,并计划恢复 COSMOS3_NANO 的 NPU 测试。重构后的采样参数提取模式值得推广到其他共享配置中。

缺陷修复 重要性 5.93 洞察度 6.00

修复 Mamba 前缀缓存长 prefill 精度下降

值得立即合并。本 PR 定位准确、修改精炼、验证充分,同时可作为优秀 bugfix 范例用于团队内部复盘:演示了如何从精度问题→跟踪日志→root cause→最小修复 的完整流程。

参与讨论