权值检查器跳过非持久化缓冲区
此 PR 为小范围 bugfix,值得快速合并。建议关注是否还有其他非持久化缓冲区需要类似处理,可后续扩展模式列表。
SGLang is a high-performance serving framework for large language models and multimodal models.
权值检查器跳过非持久化缓冲区
此 PR 为小范围 bugfix,值得快速合并。建议关注是否还有其他非持久化缓冲区需要类似处理,可后续扩展模式列表。
修复权值检查器 FP8 反量化与非持久化缓冲区跳过
可以合并,无需进一步审查。建议在后续开发中关注 weight_checker 的扩展性,例如将非持久化缓冲区名称配置化,便于维护。
原始 PR · 作者 merrymercy · 合并时间 2026-05-06 20:30
修复 PD 场景下 abort() 状态同步缺失
值得阅读,尤其关注 common/conn.py 中的基类修复模式——通过统一基类而非各处修改来修复跨后端的 bug,是良好的工程实践。Mooncake 子类删除后应关注是否有其他自定义行为丢失(经检查没有)。
修复 KV 传输指标并统一接口
值得精读,尤其是 `KVTransferMetric` 的抽象设计和 `duration_between` 的安全模式。开发者可借此学习如何在不破坏现有接口的前提下统一异构后端的指标报告。此外,review 中关于预计算长度和避免 `assert` 的建议也值得在日常开发中参考。
移除测试文件中未使用的导入
这是一个简单的 lint 修复,可以直接合并,无需深入审查。
删除独立 CUDA 13 安装步骤,默认 CUDA 13
该 PR 是日常维护型文档更新,无需深度阅读。但值得关注的是,它标志着 SGLang 默认环境正式切换至 CUDA 13,对于关注 CUDA 版本兼容性的开发者是一个重要信号。
修复扩散模型 CFG 并行中非连续张量通信崩溃
建议合并此 PR,因为它修复了 CPG 并行在 JoyAI 等模型上的功能性崩溃,并带来了显著的性能提升。但在合并前,应评估 review 中提出的 in-place 语义问题——如果调用者依赖原始张量更新,需复制回结果(如 `input_.copy_(contiguous_result)`);若当前所有调用者都不依赖,则可忽略。建议补充一个单元测试用例,覆盖非连续张量输入场景。
原始 PR · 作者 wangfakang · 合并时间 2026-05-06 17:07
解耦 NCCL 注册与分配,支持跨组内存复用
值得精读,尤其关注 C++ 跟踪 + Python 延迟注册的边界设计,以及如何在避免数据复制的同时保持正确性。适合理解对称内存分配器的演进。
参与讨论