#29645 Support real draft tokens to simulated acceptance
原始 PR · 作者 weireweire · 合并时间 2026-07-01 08:22
新增真实 draft token 模拟接受模式
值得快速阅读:PR 虽小但展示了在有兼容性约束下如何逐步改进模拟逻辑的设计思路。核心决策点是保持向后兼容的同时引入可选的正确性修复。建议后续跟进添加单元测试覆盖 `generate_simulated_accept_index` 的核心分支。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 weireweire · 合并时间 2026-07-01 08:22
新增真实 draft token 模拟接受模式
值得快速阅读:PR 虽小但展示了在有兼容性约束下如何逐步改进模拟逻辑的设计思路。核心决策点是保持向后兼容的同时引入可选的正确性修复。建议后续跟进添加单元测试覆盖 `generate_simulated_accept_index` 的核心分支。
修复 SWA 恢复时覆盖锁定 Full KV
值得精读,尤其是对 radix cache 和 SWA 组件交互边界感兴趣的同学。新增的 `_restore_device_value_with_locked_full` 和 `_recover_tombstone_keeping_locked_full` 设计体现了在锁定资源下做部分恢复的通用思路。建议同时阅读关联 PR #29353 理解完整修复上下文。
原始 PR · 作者 zyzshishui · 合并时间 2026-07-01 05:53
修复 custom all-reduce v2 在 torch memory saver 下 CUDA graph 捕获失败
小而关键的 bugfix,值得精读其讨论以理解 CUDA graph 捕获和 TMS 交互的细节。建议 reviewer 关注 C++ 侧 `m_is_graph_capturing` 语义的理解。
为 GLM-5.2 Cookbook 添加 AMD MI300X/MI325X/MI355X 支持
该 PR 值得精读,特别是学习如何通过 `disable` + `disableReason` 优雅处理硬件限制,以及如何基于已验证的架构快速扩展多硬件支持。文档中的警告和版本固定策略也值得借鉴。
原始 PR · 作者 sglang-bot · 合并时间 2026-07-01 04:48
同步 LMSYS SGLang 博客卡片
值得合并,但建议关注图片链接的可靠性,后续可引导 bot 或文档作者使用官方托管图片。
原始 PR · 作者 TrafalgarZZZ · 合并时间 2026-07-01 02:54
修正mooncake包名从mooncake改为mooncake-transfer-engine
值得合并。虽然是微小改动,但能避免用户因错误包名导致安装失败,提升开发者体验。
修复 Ascend NPU 文档格式与链接问题
适合作为文档规范性清理的参考 PR。若你负责文档维护,可以学习其中对 Markdown 格式和链接检查的系统性方法。但无需硬啃源码部分(无代码变更)。值得注意的是 reviewer 对细节的严格把关,这种 review 文化值得借鉴。
修复SWA跳过叶子创建导致Full KV丢失的问题
值得精读,特别是统一缓存组件设计模式及如何通过消除组件间副作用依赖来保持核心路径的鲁棒性。关注 Review 中关于添加 assert 的讨论,体现了在不同配置边界下的权衡决策。
参与讨论