为 GLM-5.2 部署文档添加 NVFP4 量化选项,限定 B300/GB300
值得阅读 `_deployment.jsx` 的镜像键解析变更,这是一个从简单键到复合键的演进,提高了灵活性。GLM-5.2 页面的 cell 设计(TP4、EAGLE 参数等)也可作为 Blackwell Ultra 部署的参考。
SGLang is a high-performance serving framework for large language models and multimodal models.
为 GLM-5.2 部署文档添加 NVFP4 量化选项,限定 B300/GB300
值得阅读 `_deployment.jsx` 的镜像键解析变更,这是一个从简单键到复合键的演进,提高了灵活性。GLM-5.2 页面的 cell 设计(TP4、EAGLE 参数等)也可作为 Blackwell Ultra 部署的参考。
为 Cosmos3 添加 CUDA cat/pad 快速路径,提速 ~2x
值得精读。重点关注 `causal_conv3d_cat_pad.py` 中的自定义 op 注册与 fake_impl 设计,以及 `parallel_conv.py` 中的 fallback 模式。该 PR 展示了 JIT 内核与 `torch.compile` 兼容的典型集成方案,对后续扩散模型优化有参考价值。
线性注意力加入ReplaySSM缓冲解码,HBM流量减半
值得精读,特别是 ReplaySSM 数学推导、CUDA Graph 安全设计、Radix 协调机制。对于部署 GDN/KDA 模型的组织是重要优化方向。
原始 PR · 作者 polisettyvarma · 合并时间 2026-06-26 13:57
XPU 条件导入 hc_split_sinkhorn 支持
值得阅读,尤其是理解如何在多平台条件导入的权衡。设计上采用按需局部导入避免 tilelang 依赖,但 reviewer 对此有不同意见,可关注最终实现。
修复 CI 后 profiling 阶段误报 spec accept length
值得精读:展示了 CI 框架中一个典型的竞态/状态残留 bug,修复优雅且低风险。
修复 PP 下 KV 事件发布者绑定冲突
建议精读此 PR,理解分布式系统中初始化资源的竞态条件及修复模式。代码变更简洁、正确,是典型的多进程协调问题。
修复 PP 下固定 HiCache 容量不同步的问题
该 PR 值得合并,修复了 PP 下 HiCache 的一个潜在正确性问题。设计决策明确:使用 MIN reduce 确保所有 stage 容量不超过最小的 stage,与 device KV 容量同步策略一致。建议阅读 `sync_fixed_hicache_size` 函数的实现,理解其安全退避逻辑。
拆分 fwd occupancy kit 报告为性能与占用双表
值得阅读以了解如何组织测试报告,尤其对于需要设计 CI 可读报告的工程师。设计决策:将不同语义的指标分离到各自表格,并在断言前打印,提高调试友好性。这对后续编写类似测试报告有参考价值。
参与讨论