Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 17:58 同步状态:空闲 下次计划:2026-09-01 18:58

PR 列表

更多筛选
2026-07-01
缺陷修复 重要性 5.97 洞察度 6.00

修复 Offloader 在 CUDA graph 捕获时的流隔离错误

值得精读,尤其是理解 CUDA graph stream capture isolation 约束和异步 prefetch 的交互。设计上采用了条件分支来动态适配捕获状态,思路清晰。后续可考虑更优雅的方案(如预分配 pinned memory 或利用 cudaMemcpyAsync 的流顺序语义)来恢复部分 overlap 收益。建议在 merge 后跟踪 torch.compile 兼容性 issue。

功能 重要性 6.08 洞察度 6.00

新增真实 draft token 模拟接受模式

值得快速阅读:PR 虽小但展示了在有兼容性约束下如何逐步改进模拟逻辑的设计思路。核心决策点是保持向后兼容的同时引入可选的正确性修复。建议后续跟进添加单元测试覆盖 `generate_simulated_accept_index` 的核心分支。

#29352 [bug2] skip swa recovery on locked full kv

原始 PR · 作者 yaof20 · 合并时间 2026-07-01 07:07

缺陷修复 重要性 7.29 洞察度 6.00

修复 SWA 恢复时覆盖锁定 Full KV

值得精读,尤其是对 radix cache 和 SWA 组件交互边界感兴趣的同学。新增的 `_restore_device_value_with_locked_full` 和 `_recover_tombstone_keeping_locked_full` 设计体现了在锁定资源下做部分恢复的通用思路。建议同时阅读关联 PR #29353 理解完整修复上下文。

缺陷修复 重要性 5.73 洞察度 7.00

修复 custom all-reduce v2 在 torch memory saver 下 CUDA graph 捕获失败

小而关键的 bugfix,值得精读其讨论以理解 CUDA graph 捕获和 TMS 交互的细节。建议 reviewer 关注 C++ 侧 `m_is_graph_capturing` 语义的理解。

文档 重要性 6.25 洞察度 6.00

为 GLM-5.2 Cookbook 添加 AMD MI300X/MI325X/MI355X 支持

该 PR 值得精读,特别是学习如何通过 `disable` + `disableReason` 优雅处理硬件限制,以及如何基于已验证的架构快速扩展多硬件支持。文档中的警告和版本固定策略也值得借鉴。

#29307 docs: sync LMSYS SGLang blog cards

原始 PR · 作者 sglang-bot · 合并时间 2026-07-01 04:48

文档 重要性 3.44 洞察度 1.00

同步 LMSYS SGLang 博客卡片

值得合并,但建议关注图片链接的可靠性,后续可引导 bot 或文档作者使用官方托管图片。

文档 重要性 4.84 洞察度 2.00

修复 Ascend NPU 文档格式与链接问题

适合作为文档规范性清理的参考 PR。若你负责文档维护,可以学习其中对 Markdown 格式和链接检查的系统性方法。但无需硬啃源码部分(无代码变更)。值得注意的是 reviewer 对细节的严格把关,这种 review 文化值得借鉴。

参与讨论