Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-05 00:20 同步状态:空闲 下次计划:2026-09-05 01:20

PR 列表

更多筛选
2026-05-05

#24059 [codex] Optimize Helios fused norm modulation

原始 PR · 作者 BBuf · 合并时间 2026-05-05 19:28

性能优化 重要性 6.11 洞察度 5.00

优化 Helios 融合归一化调制,消除冗余 FP32 转换

该 PR 是一次典型的 kernel fusion 性能优化,设计简洁且有效。建议:1)确认 `LayerNorm` 构造时显式传入 `bias=True` 以避免未来歧义;2)考虑添加数值一致性测试(如 PSNR/SSIM)以量化验证图像质量无退化。整体上值得合并。

#23199 Add HunyuanVideo ModelOpt FP8 diffusion support

原始 PR · 作者 BBuf · 合并时间 2026-05-05 19:27

功能 重要性 8.53 洞察度 5.00

为 HunyuanVideo 添加 ModelOpt FP8 量化支持

适合有意在 SGLang 中集成新量化模型的工程师阅读,重点关注 `build_modelopt_fp8_transformer.py` 中的命名映射机制和 `ReplicatedLinear` 的泛化设计。

缺陷修复 重要性 5.49 洞察度 4.00

修复 EAGLE SpecV2 + TBO 下 seq_lens_cpu 空指针问题

值得快速合入,修复明确,影响范围小。可作为 AMD 平台 SpecV2 兼容性修复的参考模式。

#24417 [Fix] Fix pypi release workflow

原始 PR · 作者 Fridge003 · 合并时间 2026-05-05 16:21

基础设施 重要性 4.81 洞察度 4.00

修复 PyPI 发布工作流,支持手动调度和 manylinux 打包

该 PR 值得合并,解决了 PyPI 发布流程中的关键问题。建议开发者在手动发布时注意输入正确的版本号。

#24411 [diffusion] Fuse LTX2 split rotary embedding

原始 PR · 作者 mickqian · 合并时间 2026-05-05 16:07

性能优化 重要性 7.58 洞察度 6.00

新增 LTX2 融合 Triton 内核,BF16 路径性能提升约 1%

值得阅读,尤其是学习如何在现有 PyTorch 操作中安全插入融合内核的策略。该 PR 展示了保证数值一致性的方法(匹配 BF16 舍入顺序)和条件回退设计,可作为后续类似优化的参考。

缺陷修复 重要性 3.92 洞察度 3.00

修复 AMD Docker 构建因镜像不可达失败的问题

该 PR 是典型的基础设施修复,变更清晰、范围有限,适合快速合入。建议阅读 `docker/rocm.Dockerfile` 中的实现,了解如何在 Dockerfile 中优雅地处理源替换和 apt 网络硬化。

AMD启用EAGLE统一注意力验证并修复MXFP4加载

值得精读,尤其关注注意力后端如何适配不同数据类型(MLA/non-MLA)和投机解码布局(ragged vs paged)。设计决策(如保持radix-cache分离)体现了模块化思维。建议后续补充单元测试覆盖新路径。

测试 重要性 7.74 洞察度 3.00

AMD 夜间测试从 K2.5 切换到 K2.6

值得关注的是 AMD 团队复用 K2.5 配置的策略,它验证了模型架构兼容性的实用检查。对于 review 中提到的 try-finally 清理模式,建议在后续 PR 中统一修改 accuracy 测试的服务器生命周期管理,以减少 CI 中的不确定失败。此外,可考虑将重复的报表生成函数抽取为公共工具,降低维护成本。

参与讨论