Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 17:58 同步状态:空闲 下次计划:2026-09-01 18:58

PR 列表

更多筛选
2026-08-12
缺陷修复 重要性 4.89 洞察度 5.00

SM120 融合 QKNorm+RoPE 舍入修复,回归通过

值得精读。这是一个典型的“编译器收缩破坏 bit-exact 语义”案例:单个头文件内用模板 `constexpr if` + 架构宏 + `asm volatile` 组合,为 SM120 强制 round-to-nearest 舍入顺序,同时为 pre-SM120 保留逐字节不变的旧算术。可重点关注:PTX `mul.rn` / `add.rn` / `sub.rn` 的位模式处理方式、`bf16_t` 与 `__half` 的统一分支写法,以及用架构 guard 控制风险面的设计。建议后续为 SM120 增加更细的独立回归用例,覆盖两种 rotary 布局与 dtype 组合。

缺陷修复 重要性 8.24 洞察度 6.00

重构模型驱动的 DiT 分层卸载自动策略

值得精读。核心价值在于将“模型配置声明”和“运行策略决策”解耦,用显式模式列表替代类名/模块名分发,是可复用的设计模式。重点关注 `auto_tune.py` 的 `_should_auto_enable_dit_layerwise_offload` 重写和 `model_deployment_config.py` 的数据契约变化,以及 MOVA 复用 `keep_resident_components` 的机制。

#34464 Refocus LoRA tests on regression coverage

原始 PR · 作者 jybsuper · 合并时间 2026-08-12 08:37

测试 重要性 7.91 洞察度 6.00

LoRA 测试聚焦回归契约,方法数削减 61%

值得精读,推荐对象是对测试治理、回归守护和 LoRA 特性感兴趣的同学。重点看三点:一是 `test_chunked_sgmv_cuda_graph.py` 如何用「捕获时 1 段、重放时 4 段」的状态切换构造 CUDA graph 动态 segment 回归,技巧可复用于其他 CUDA graph 类测试;二是 `test_lora_manager_tied_lm_head.py` 用 `patch.object` + `patch.dict(sys.modules)` 在 CPU 上复现 GPU/模型加载路径的回归,极大降低成本;三是 PR body 的 admission 决策表是测试裁剪的范本,可迁移到其他测试套件。若你负责 LoRA 相关改动,建议后续改动时先跑这些契约验证。

功能 重要性 8.80 洞察度 7.00

FlashInfer 纯 allreduce 后端,复用融合 workspace 加速 DSV3/V4

值得精读,尤其是以下三个设计决策:1) `can_use_flashinfer_allreduce` 与 `flashinfer_allreduce` 的拆分——如何在 Dynamo 符号执行下保持判定 rank-invariant 且不引入 Dynamo guard 重编译;2) workspace 与进程组精确绑定的必要性——hybrid EP+TP 下同 world size 不同 rank 集合会静默产生错误归约,这是分布式正确性中易被忽视的细节;3) custom op 包装对 piecewise CUDA graph 的支持方式。建议结合 PR#32330 的 SM120 修复与 PR#32339 的性能对比一起阅读,可形成对多节点 allreduce 路径选型的完整认识。

#34472 [Misc] Sanitize the structure of environ.py

原始 PR · 作者 Fridge003 · 合并时间 2026-08-12 07:31

重构 重要性 6.75 洞察度 3.00

重排 environ.py 环境变量分组,清理废弃开关

值得快速浏览 diff,学习如何组织超大型 Envs 类(按功能主题分区、删除死开关);不适合精读,因无算法和设计决策。建议合并后 grep 全仓库确认被删键无残留引用,并关注 CI 失败是否已另行处理。

#34357 Update Qwen3.5 B200 NVFP4 MTP config

原始 PR · 作者 faradawn · 合并时间 2026-08-12 07:12

文档 重要性 4.46 洞察度 4.00

Qwen3.5 B200 NVFP4 MTP 改用 tp=2+EP2 配置

值得快速阅读:它展示了如何基于外部基准在配置生成器中沉淀经过实测的部署配方,体现 MoE 场景下 TP+EP 组合优于纯 TP 的权衡。如需深入了解 MTP 与并行策略的互动,可结合 InferenceX PR#2550 阅读。

性能优化 重要性 8.00 洞察度 6.00

XPU MoE 权重行 stride 填充 64B 规避 L3 aliasing

值得精读。该 PR 把硬件内存系统(L3 set aliasing)分析转化成一段很小但精准的分配逻辑,展示了'不改逻辑 shape、只调 stride'的兼容性设计,并配套了设备门控与 bit-exact 数值测试。对关注 Intel XPU 性能或 MoE kernel 调优的工程师尤其有参考价值;后续在 XPU 上做其他 GEMM 算子优化时可复用相同的 padding 常量与判定函数。

#34262 [Feature] Add Muse Glimmer model support

原始 PR · 作者 sglang-bot · 合并时间 2026-08-12 06:41

功能 重要性 9.36 洞察度 8.00

新增 Muse Glimmer 模型原生支持,覆盖 CUDA 与 MLX 双后端

值得精读。重点看三处设计:一是 `muse_glimmer_mlx.py::sanitize()` 对三种 checkpoint 布局的判别与变换(offset norm 折叠、q/gate per-head interleave、位置性 norm 重命名),这是处理 vendor 私有格式的范例;二是 `MuseGlimmerDetector` 的 `preserve_channels` 机制,解决被引用的工具标记与真实工具调用的歧义,对流式解析器设计有借鉴意义;三是 `remote_code_gate.py` 在 mlx-lm 无 trust_remote_code 参数的情况下前置安全检查的思路。

参与讨论