Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-07-23

#32091 [CI] Fix failures on main

原始 PR · 作者 mmangkad · 合并时间 2026-07-23 00:11

缺陷修复 重要性 4.60 洞察度 3.00

修复 CI main 分支导入和测试断言问题

建议快速合并以恢复 CI 健康状态。该 PR 可作为示例:展示如何在引入新 API 后及时更新相关模块的导入,以及如何因生产代码变更而修正测试断言。

#32096 Fix get_server_args import lint error

原始 PR · 作者 ispobock · 合并时间 2026-07-23 00:09

缺陷修复 重要性 4.20 洞察度 2.00

修复 qwen3.5 未导入 get_server_args

该 PR 是紧急导入修复,技术价值较低。但建议关注:①相似问题是否在其他模型文件中存在;②#24651 的 PR 审查是否漏检了导入。可以精读 #24651 的合并情况。

2026-07-22

#32095 Add Inkling per-commit server test

原始 PR · 作者 ispobock · 合并时间 2026-07-22 23:56

测试 重要性 7.75 洞察度 2.00

添加 Inkling per-commit 端到端服务器测试

该 PR 展示了如何为复杂模型设计快速端到端 CI 测试,值得借鉴在测试中启动服务器、配置特定参数、覆盖多模态等做法。但测试本身较为简单,没有深入验证数值正确性。建议后续可以增加对输出的结构验证和更广泛的多模态场景。

缺陷修复 重要性 5.52 洞察度 4.00

修复 streaming 中 partial JSON 解析断言异常

建议合入此 PR。它是一个典型的小型防御性修复,虽简单但有效防止了特定输入导致的请求中断。阅读 `_partial_json_loads` 的异常处理结构可获得防御性编程启发。

#31889 [AMD] Cache AITER expert mask across decode

原始 PR · 作者 zx3xyy · 合并时间 2026-07-22 22:50

性能优化 重要性 4.90 洞察度 3.00

AMD AITER MoE 专家掩码缓存优化

推荐合并。该 PR 是典型的微小性能优化,改动清晰且经过内部验证,无副作用。Approver 已批准,可直接合并。

功能 重要性 9.18 洞察度 7.00

AMD 融合 AllReduce-RMSNorm 量化内核

值得精读。该 PR 展示了如何在框架中优雅地引入厂商特定融合内核:通过惰性门控、分层回退、元组数据契约和清晰的测试策略,值得其他平台优化参考。建议关注 `layernorm.py` 中的 `_forward_with_allreduce_fusion_quant_per_group` 回退链设计,以及 `qwen3_5.py` 中 `_select_fused_ar_input_for_linear` 的元组类型分发逻辑。

#32076 Fix Inkling kernel imports after migration

原始 PR · 作者 mmangkad · 合并时间 2026-07-22 22:09

缺陷修复 重要性 5.63 洞察度 1.00

修复 Inkling JIT 内核迁移后的导入路径

推荐合并。该 PR 是此前 JIT 内核迁移工作(#32045)的补丁,修复了一个阻止 Inkling 模型启动的回归缺陷。变更简洁、验证充分,值得快速跟进。

参与讨论