Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-04 00:39 同步状态:空闲 下次计划:2026-09-04 01:39

PR 列表

更多筛选
2026-04-28

#22961 [NPU] Fix issue and support GLM-4.5V

原始 PR · 作者 zhsurpass · 合并时间 2026-04-28 09:08

缺陷修复 重要性 6.19 洞察度 3.00

NPU 支持 GLM-4.5V 并修复 QK Norm 参数传递

建议阅读 glm4_moe.py 中 forward_prepare 的条件分支设计,了解 NPU 后端如何处理 QK Norm 可选的情况。对于其他需要类似支持的模型可复用此模式。

性能优化 重要性 6.02 洞察度 4.00

HiCache 预取自适应剩余可用内存优化

本 PR 是一次针对性的性能优化,逻辑清晰,值得阅读以理解 HiCache 预取流程和内存自适应策略。对于使用 HiCache 的部署场景,该改动能带来实际收益。建议在合并后运行相关测试(如 test_hicache_storage_mooncake_backend)验证无回归。

#23886 [PD+Pause] Remove redundant post processing

原始 PR · 作者 ByronHsu · 合并时间 2026-04-28 08:01

重构 重要性 4.00 洞察度 3.00

移除 PD Pause 中冗余的 inflight 处理调用

该 PR 改动简单、风险低,可直接合并。对于从事 disaggregation prefill 或调度器开发的团队成员有一定参考意义,可了解 `process_disagg_prefill_inflight_queue` 的当前语义和调用场景。

#23801 docs: update Python prerequisite to 3.10

原始 PR · 作者 Kare0638 · 合并时间 2026-04-28 06:36

文档 重要性 2.47 洞察度 2.00

文档中 Python 版本要求更新至 3.10+

建议精读,虽然是简单变更,但体现了保持文档与代码同步的重要性,适合作为文档维护的参考案例。

缺陷修复 重要性 6.00 洞察度 5.00

修复 EAGLE3 分段 CUDA Graph 下 mm_input 丢失

值得精读:该 PR 修复了一个涉及分段 CUDA Graph 和推测解码交互的边界问题,代码简洁且有明确条件守卫,是理解 SGLang 推测解码与 CUDA Graph 如何协作的良好范例。

参与讨论