Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 20:51 同步状态:空闲 下次计划:2026-09-02 21:51

PR 列表

更多筛选
2026-06-21
功能 重要性 8.80 洞察度 6.00

为 speculative decoding 添加经典拒绝采样,提升接受长度和吞吐

建议架构师和服务化团队精读此 PR,特别是 `reject_sampling.py` 中 Triton 内核的两轮残差采样实现,该模式可复用于其他需要从修正分布采样的场景。同时,review 中关于缓冲区使用的对话也体现了 CUDA Graph 场景下组件间契约设计的良好实践。

基础设施 重要性 7.72 洞察度 3.00

删除遗留 test/srt CI 设置,迁移至注册制测试框架

值得快速合并,这是一项干净的基础设施清理。建议项目成员阅读 `test/README.md` 了解注册制测试框架(`test/run_suite.py`),未来添加测试时遵循新流程。

#28807 Clean up startup log noise

原始 PR · 作者 merrymercy · 合并时间 2026-06-21 06:02

重构 重要性 5.45 洞察度 2.00

清理启动日志噪声,移除冗余日志和 import

该 PR 是低风险清理,可快速合并。建议关注是否有可能在调试时需要这些日志,若需可考虑改为 debug 级别而非直接移除。

缺陷修复 重要性 6.90 洞察度 5.00

修复 HIP 动态调度 dtype 转换无操作 bug

该 PR 值得所有 AMD HIP 用户关注。设计亮点:作者通过对比静态路径的正确实现,发现动态路径中因变量覆盖顺序导致的常见 bug 模式(no-op cast)。新增的测试设计清晰,覆盖边界情况,可作为类似 bugfix 测试的参考。

2026-06-20
功能 重要性 7.09 洞察度 5.00

在序列并行下对 HunyuanVideo 文本 token 进行分片,降低通信开销

该 PR 是针对特定分布式配置的有效性能优化,设计清晰(条件判定+通道分离),值得关注其变长通信原语的复用潜力。建议阅读 `layer.py` 中的 `seq_lens` 分支实现。

测试 重要性 4.93 洞察度 2.00

移除不稳定的 layerwise_offload 扩散测试用例

该 PR 是清理 flaky 测试的常规维护,不值得精读。但如果团队维护 layerwise offload 功能,建议关注是否用更小、更快的模型重建测试以保持回归检测,或依赖其他扩散测试场景来覆盖。

性能优化 重要性 7.93 洞察度 6.00

优化 DeepSeek-V4 在 AMD GPU 上的 FP8 GEMM 和 RoPE 性能

1. 建议在后续 PR 中修复类型转换问题,对 `out_real` 和 `out_imag` 添加 `.to(x_ptr.dtype.element_ty)`。 2. 使用 `get_bool_env_var` 初始化模块级开关,使环境变量覆盖生效。 3. 补充单元测试覆盖新内核的正确性(如与旧内核输出一致性测试)。 4. 关注 #28783 中的 BLOCK_M 调优结果,适时合并。 5. 值得学习的点:通过松耦合的模块级标志和模型构造函数 opt-in,在不影响其他模型的前提下对特定模型实施性能优化。

参与讨论