Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 20:51 同步状态:空闲 下次计划:2026-09-02 21:51

PR 列表

更多筛选
2026-08-05
功能 重要性 4.66 洞察度 4.00

XPU 上 fused_k_norm_rope_flashmla 改用 sgl-kernel 实现

值得快速浏览:改动虽小,但清晰地展示了 SGLang 多平台内核分派的典型模式。重点可关注 jianan-gu 提出的架构建议——未来将 OP 导入从 JIT 路径中抽离,统一由平台 kernel 库提供,可作为后续重构方向。若你在维护 XPU 支持,建议补充针对 `page_size` 边界和 `kvcache` 布局的单元测试。

测试 重要性 6.55 洞察度 3.00

新增 Qwen3.5 MTP+ReplaySSM+FlashInfer GDN 端到端测试

值得快速浏览(约 5 分钟)。本 PR 是纯测试补强,虽无源码改动,但类 docstring 清晰记录了两种设计决策:一是用 --mamba-ssm-dtype bfloat16 覆盖 ReplaySSM 的 float32 默认状态,二是用三个显式后端参数钉住 FlashInfer,防止自动选择漂移。这种『显式钉住后端 + 覆盖默认 dtype』的测试写法,适合作为新增 spec-verify 协议回归测试的模板。不建议精读源码,因为不涉及运行时逻辑。

缺陷修复 重要性 7.21 洞察度 5.00

共享 RoPE 缓存失效自动重建,防查询静默未旋转

值得精读。代码量小但揭示了一个典型的进程级共享缓存与模型生命周期相互干扰的问题,`_get_live_rope_cache_entry` 的设计(用默认设备区分“有意构建的 meta 条目”与“被 teardown 杀死的条目”)有借鉴意义。建议结合测试用例一起阅读,并关注后续对 `multimodal_gen` 副本的同步修复。

文档 重要性 3.72 洞察度 1.00

Kimi-K3 B300 配方移除 all-reduce 禁用

该 PR 不值得精读,属于文档配置示例的单行修正。可简单了解 Kimi-K3 部署配方的演进,以及 custom all-reduce / fused all-reduce auto-probe 在 B300 场景下的取舍;若关注 DSPARK、HiCache off 组合下的 all-reduce 行为,可结合相关运行时 PR 一起看。

测试 重要性 7.86 洞察度 6.00

用层单元测试替换 NVFP4 MoE e2e 矩阵,CI 提速

值得精读,尤其是 `_torch_moe_reference` 如何通过镜像 kernel 的 NVFP4 量化往返(两次 `fp4_quantize`)来控制参考误差,以及 `runtime_context` override 机制让单测无需起 server 即可驱动不同 MoE runner backend。该测试可作为 NVFP4 相关 kernel 回归测试的模板。建议后续补充 EP 分布式路径的最小化验证,避免完全依赖单测。

基础设施 重要性 3.27 洞察度 2.00

B200 两个 4-GPU 测试移入 base-c 套件

值得快速浏览,不必精读。核心价值在于它释放了 base-b 4-GPU 测试压力,是 B200 单 GPU runner 迁移的第一步。关注 CI 基础设施演进的工程师可以留意后续 1-GPU runner 落地 PR;本 PR 本身只是注册参数调整,设计上没有额外值得深挖的点。

测试 重要性 8.29 洞察度 6.00

用层级单元测试替换 GEMM e2e 矩阵,CI 提速并修复 block 检查

值得精读,特别是 test_nvfp4_linear_backends.py 中 convert_swizzled_to_linear 的 K-tile crop 修复和 test_fp8_blockwise_linear_backends.py 的按 SM 自适应后端集合设计。这两个文件是量化后端测试的优质模板,展示了如何在不启动服务器的情况下覆盖 kernel 专属的 padding / swizzle / scale 布局逻辑。同时建议关注 fp8.py 的修复是否与后续 skip_block_quant_check 调用方有交互。

#33537 Multiple flexibility fixes for DP attention

原始 PR · 作者 merrymercy · 合并时间 2026-08-05 06:40

缺陷修复 重要性 7.90 洞察度 5.00

DP 注意力兼容自适应推测解码,修复 MLP 同步与图大小

值得精读。PR 展示了如何把内联初始化逻辑提取为可复用 API 的同时保持行为等价,以及如何用单个 helper 统一两个可能产生分歧的图尺寸计算点;对编写自定义 speculative 算法或扩展 DP attention 的工程师有参考价值。

参与讨论