Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-05 00:20 同步状态:空闲 下次计划:2026-09-05 01:20

PR 列表

更多筛选
2026-06-26

#29258 Fix fixed-size HiCache capacity under PP

原始 PR · 作者 ziang663 · 合并时间 2026-06-26 12:49

缺陷修复 重要性 6.61 洞察度 5.00

修复 PP 下固定 HiCache 容量不同步的问题

该 PR 值得合并,修复了 PP 下 HiCache 的一个潜在正确性问题。设计决策明确:使用 MIN reduce 确保所有 stage 容量不超过最小的 stage,与 device KV 容量同步策略一致。建议阅读 `sync_fixed_hicache_size` 函数的实现,理解其安全退避逻辑。

测试 重要性 5.96 洞察度 4.00

拆分 fwd occupancy kit 报告为性能与占用双表

值得阅读以了解如何组织测试报告,尤其对于需要设计 CI 可读报告的工程师。设计决策:将不同语义的指标分离到各自表格,并在断言前打印,提高调试友好性。这对后续编写类似测试报告有参考价值。

#29303 [NPU] fix best practicce docs

原始 PR · 作者 Hide-on-bushsh · 合并时间 2026-06-26 11:17

文档 重要性 2.83 洞察度 1.00

修复 Ascend NPU 最佳实践文档中的命令示例和环境变量引用问题

该 PR 是一次标准的文档维护,适合需要了解 NPU 平台最佳实践的用户参考。对于开发者来说,改动很直观,无需深入审查。

文档 重要性 4.67 洞察度 3.00

GLM-5.1 EAGLE 支持扩展到 AMD gfx942

此 PR 主要涉及文档和部署配置,适合需要部署 GLM-5.1 在 AMD GPU 上的团队阅读。设计决策中的死锁分析(aiter 自定义 all-reduce 内核问题)值得关注,但在当前 PR 中未深入讨论。

基础设施 重要性 6.33 洞察度 5.00

AMD MI355X 2节点1P1D分解式夜间基准测试

值得仔细阅读,特别是其自包含 CI 设计、GSM8K 门控与性能测量的结合方式、以及自动镜像解析策略。该 PR 可作为 AMD 平台后续模型基准测试的模板。

#18139 Add Intel Quantization Support in SGLang

原始 PR · 作者 mengniwang95 · 合并时间 2026-06-26 09:54

功能 重要性 8.94 洞察度 4.00

集成 Intel AutoRound 量化,新增 auto-round-int8 支持

值得精读,特别是 `IncModelLoader` 的实现展示了如何将外部量化库集成到 SGLang 的模型加载体系中。设计上采用了继承 `DefaultModelLoader` 的方式,复用权重加载后处理流程,值得借鉴。建议关注离线量化保存路径的约定(scheme 子文件夹)以及在线量化后如何重新初始化模型架构。

文档 重要性 4.18 洞察度 2.00

为NPU模型教程添加环境前置条件并更新安装指南

值得合并,提升了 NPU 文档的完整性和用户引导性。建议将来在类似教程中保持相同的 Environment 小节模板,并定期检查链接有效性。

参与讨论