修复 PP 下固定 HiCache 容量不同步的问题
该 PR 值得合并,修复了 PP 下 HiCache 的一个潜在正确性问题。设计决策明确:使用 MIN reduce 确保所有 stage 容量不超过最小的 stage,与 device KV 容量同步策略一致。建议阅读 `sync_fixed_hicache_size` 函数的实现,理解其安全退避逻辑。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 PP 下固定 HiCache 容量不同步的问题
该 PR 值得合并,修复了 PP 下 HiCache 的一个潜在正确性问题。设计决策明确:使用 MIN reduce 确保所有 stage 容量不超过最小的 stage,与 device KV 容量同步策略一致。建议阅读 `sync_fixed_hicache_size` 函数的实现,理解其安全退避逻辑。
拆分 fwd occupancy kit 报告为性能与占用双表
值得阅读以了解如何组织测试报告,尤其对于需要设计 CI 可读报告的工程师。设计决策:将不同语义的指标分离到各自表格,并在断言前打印,提高调试友好性。这对后续编写类似测试报告有参考价值。
原始 PR · 作者 Hide-on-bushsh · 合并时间 2026-06-26 11:17
修复 Ascend NPU 最佳实践文档中的命令示例和环境变量引用问题
该 PR 是一次标准的文档维护,适合需要了解 NPU 平台最佳实践的用户参考。对于开发者来说,改动很直观,无需深入审查。
原始 PR · 作者 JustinTong0323 · 合并时间 2026-06-26 11:00
FlashMLA pin 升级 + CUDA 13 cccl 修复
建议合并。变更范围小,验证充分,且解决了 CUDA 13 兼容性问题。值得关注的是 FlashMLA 的 pin 管理策略,未来类似依赖升级可参考此 PR 的验证流程。
原始 PR · 作者 Raiden-Makoto · 合并时间 2026-06-26 10:49
GLM-5.1 EAGLE 支持扩展到 AMD gfx942
此 PR 主要涉及文档和部署配置,适合需要部署 GLM-5.1 在 AMD GPU 上的团队阅读。设计决策中的死锁分析(aiter 自定义 all-reduce 内核问题)值得关注,但在当前 PR 中未深入讨论。
AMD MI355X 2节点1P1D分解式夜间基准测试
值得仔细阅读,特别是其自包含 CI 设计、GSM8K 门控与性能测量的结合方式、以及自动镜像解析策略。该 PR 可作为 AMD 平台后续模型基准测试的模板。
原始 PR · 作者 mengniwang95 · 合并时间 2026-06-26 09:54
集成 Intel AutoRound 量化,新增 auto-round-int8 支持
值得精读,特别是 `IncModelLoader` 的实现展示了如何将外部量化库集成到 SGLang 的模型加载体系中。设计上采用了继承 `DefaultModelLoader` 的方式,复用权重加载后处理流程,值得借鉴。建议关注离线量化保存路径的约定(scheme 子文件夹)以及在线量化后如何重新初始化模型架构。
为NPU模型教程添加环境前置条件并更新安装指南
值得合并,提升了 NPU 文档的完整性和用户引导性。建议将来在类似教程中保持相同的 Environment 小节模板,并定期检查链接有效性。
参与讨论