Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 22:27 同步状态:空闲 下次计划:2026-09-03 23:27

PR 列表

更多筛选
2026-06-05
重构 重要性 8.99 洞察度 7.00

用 batch 携带的 attention plan marker 替换 skip_attn_backend_init

强烈建议阅读。PR 展示了如何用 batch 携带的状态替换控制耦合,以及如何通过 opt-in 的 plan record 安全地实现 staleness re-plan,是 speculative decoding 路径中一次重要的基础设施重构。设计思路(将断言从调用链远处转移到数据本身)值得其他类似场景借鉴。

#26496 Changes for SM120 perf and usability for NVFP4

原始 PR · 作者 b8zhong · 合并时间 2026-06-05 06:29

性能优化 重要性 7.07 洞察度 5.00

SM120 NVFP4 性能与可用性优化

值得精读,该 PR 展示了针对特定硬件 (SM120) 进行系统性性能优化的典型方法:从后端选择、autotune 触发、kernel 配置到量化修复,覆盖了整个推理链路。设计权衡(如后端切换原因、配置一致性处理)有参考价值。建议重点关注 `_should_run_flashinfer_autotune` 和 `try_get_optimal_moe_config` 的变更逻辑。

#27296 Add --enable-symm-mem for Qwen3.5

原始 PR · 作者 faradawn · 合并时间 2026-06-05 06:23

功能 重要性 3.67 洞察度 2.00

为 Qwen3.5 添加 H100 FP8 下的 --enable-symm-mem 支持

建议合并,属于有益的文档改进。无需深度审查。

功能 重要性 5.40 洞察度 3.00

支持 FlashInfer NVFP4 4over6 缩放模式

变更简洁清晰,适合快速精读。重点观察环境变量命名规范以及量化缩放因子的计算逻辑,后续维护时需注意与 FlashInfer 升级的同步。

#23979 Enable DeepGEMM PDL on by default

原始 PR · 作者 b8zhong · 合并时间 2026-06-05 05:13

功能 重要性 5.42 洞察度 5.00

默认启用 DeepGEMM PDL 优化

该 PR 值得精读,展示了如何通过环境变量默认启用底层库优化,并保持向后兼容性。但应注意 CUDA context 问题已在后续修复,建议阅读时一并参考 PR#27671。设计上采用了"安全导入 + 特性检测"模式,值得在其他类似场景复用。

参与讨论