修复 Offloader 在 CUDA graph 捕获时的流隔离错误
值得精读,尤其是理解 CUDA graph stream capture isolation 约束和异步 prefetch 的交互。设计上采用了条件分支来动态适配捕获状态,思路清晰。后续可考虑更优雅的方案(如预分配 pinned memory 或利用 cudaMemcpyAsync 的流顺序语义)来恢复部分 overlap 收益。建议在 merge 后跟踪 torch.compile 兼容性 issue。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 Offloader 在 CUDA graph 捕获时的流隔离错误
值得精读,尤其是理解 CUDA graph stream capture isolation 约束和异步 prefetch 的交互。设计上采用了条件分支来动态适配捕获状态,思路清晰。后续可考虑更优雅的方案(如预分配 pinned memory 或利用 cudaMemcpyAsync 的流顺序语义)来恢复部分 overlap 收益。建议在 merge 后跟踪 torch.compile 兼容性 issue。
原始 PR · 作者 weireweire · 合并时间 2026-07-01 08:22
新增真实 draft token 模拟接受模式
值得快速阅读:PR 虽小但展示了在有兼容性约束下如何逐步改进模拟逻辑的设计思路。核心决策点是保持向后兼容的同时引入可选的正确性修复。建议后续跟进添加单元测试覆盖 `generate_simulated_accept_index` 的核心分支。
修复 SWA 恢复时覆盖锁定 Full KV
值得精读,尤其是对 radix cache 和 SWA 组件交互边界感兴趣的同学。新增的 `_restore_device_value_with_locked_full` 和 `_recover_tombstone_keeping_locked_full` 设计体现了在锁定资源下做部分恢复的通用思路。建议同时阅读关联 PR #29353 理解完整修复上下文。
原始 PR · 作者 zyzshishui · 合并时间 2026-07-01 05:53
修复 custom all-reduce v2 在 torch memory saver 下 CUDA graph 捕获失败
小而关键的 bugfix,值得精读其讨论以理解 CUDA graph 捕获和 TMS 交互的细节。建议 reviewer 关注 C++ 侧 `m_is_graph_capturing` 语义的理解。
为 GLM-5.2 Cookbook 添加 AMD MI300X/MI325X/MI355X 支持
该 PR 值得精读,特别是学习如何通过 `disable` + `disableReason` 优雅处理硬件限制,以及如何基于已验证的架构快速扩展多硬件支持。文档中的警告和版本固定策略也值得借鉴。
原始 PR · 作者 sglang-bot · 合并时间 2026-07-01 04:48
同步 LMSYS SGLang 博客卡片
值得合并,但建议关注图片链接的可靠性,后续可引导 bot 或文档作者使用官方托管图片。
原始 PR · 作者 TrafalgarZZZ · 合并时间 2026-07-01 02:54
修正mooncake包名从mooncake改为mooncake-transfer-engine
值得合并。虽然是微小改动,但能避免用户因错误包名导致安装失败,提升开发者体验。
修复 Ascend NPU 文档格式与链接问题
适合作为文档规范性清理的参考 PR。若你负责文档维护,可以学习其中对 Markdown 格式和链接检查的系统性方法。但无需硬啃源码部分(无代码变更)。值得注意的是 reviewer 对细节的严格把关,这种 review 文化值得借鉴。
参与讨论