Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-04 00:39 同步状态:空闲 下次计划:2026-09-04 01:39

PR 列表

更多筛选
2026-06-26
功能 重要性 6.83 洞察度 5.00

为 GLM-5.2 部署文档添加 NVFP4 量化选项,限定 B300/GB300

值得阅读 `_deployment.jsx` 的镜像键解析变更,这是一个从简单键到复合键的演进,提高了灵活性。GLM-5.2 页面的 cell 设计(TP4、EAGLE 参数等)也可作为 Blackwell Ultra 部署的参考。

性能优化 重要性 8.98 洞察度 5.00

为 Cosmos3 添加 CUDA cat/pad 快速路径,提速 ~2x

值得精读。重点关注 `causal_conv3d_cat_pad.py` 中的自定义 op 注册与 fake_impl 设计,以及 `parallel_conv.py` 中的 fallback 模式。该 PR 展示了 JIT 内核与 `torch.compile` 兼容的典型集成方案,对后续扩散模型优化有参考价值。

#29044 Fix KV event publisher bind conflict under PP

原始 PR · 作者 ziang663 · 合并时间 2026-06-26 12:50

缺陷修复 重要性 5.25 洞察度 6.00

修复 PP 下 KV 事件发布者绑定冲突

建议精读此 PR,理解分布式系统中初始化资源的竞态条件及修复模式。代码变更简洁、正确,是典型的多进程协调问题。

#29258 Fix fixed-size HiCache capacity under PP

原始 PR · 作者 ziang663 · 合并时间 2026-06-26 12:49

缺陷修复 重要性 6.61 洞察度 5.00

修复 PP 下固定 HiCache 容量不同步的问题

该 PR 值得合并,修复了 PP 下 HiCache 的一个潜在正确性问题。设计决策明确:使用 MIN reduce 确保所有 stage 容量不超过最小的 stage,与 device KV 容量同步策略一致。建议阅读 `sync_fixed_hicache_size` 函数的实现,理解其安全退避逻辑。

测试 重要性 5.96 洞察度 4.00

拆分 fwd occupancy kit 报告为性能与占用双表

值得阅读以了解如何组织测试报告,尤其对于需要设计 CI 可读报告的工程师。设计决策:将不同语义的指标分离到各自表格,并在断言前打印,提高调试友好性。这对后续编写类似测试报告有参考价值。

参与讨论