Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-05 01:23 同步状态:空闲 下次计划:2026-09-05 02:23

PR 列表

更多筛选
2026-05-10
缺陷修复 重要性 5.69 洞察度 6.00

修复 Mooncake 后端未传输 DSv4 状态池的 Bug

值得精读,尤其是关注解耦推理、MLA 状态传输或 Mooncake 后端的开发者。设计决策(委托 `_send_kvcache_generic` 而非新建扁平路径)体现了对 MTP 场景兼容性的考量,值得学习。

重构 重要性 8.78 洞察度 7.00

拆分推测解码V1 Draft/Extend数据结构

该 PR 值得精读,尤其是 `eagle_info.py` 与 `frozen_kv_mtp_info.py` 中的数据结构设计。对于从事推测解码开发的工程师,可以学习如何通过类型拆分消除阶段混淆。PR body 中的“Looks confusing but is correct”部分对设计权衡有清晰解释,可作为代码注释的典范。建议在合并前或合并后补充 V2 对齐的 issue 跟踪。

性能优化 重要性 8.42 洞察度 7.00

融合QKV RMSNorm并修复FP8 MoE权重加载

此PR包含两个值得关注的设计:融合Triton内核使用stride view避免拷贝,以及保守的fallback策略;加载器中的正则映射模式可复用于其他支持per-expert格式的模型。测试用例的三阶段设计(健康、非垃圾、精度)提供良好的回归保护。

#24826 [spec decoding] support kimi-k2.5-eagle3-mla

原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-05-10 14:57

功能 重要性 8.12 洞察度 5.00

支持 Kimi-K2.5 EAGLE3 MLA 推测解码模型

值得精读 EAGLE3 与 MLA 结合的设计,特别是如何通过替换 `fused_qkv_a_proj_with_mqa` 来适配拼接输入。建议后续补充单元测试覆盖前向逻辑与权重加载。

缺陷修复 重要性 5.71 洞察度 5.00

修复 Spec-V2 重叠调度中过时状态更新导致的 KV 记账错误

建议阅读核心逻辑变更和 review 讨论,理解异步过时状态处理的设计权衡;全局指标一致性问题可作后续优化方向。

#19213 [diffusion] Add cache-dit CI tests

原始 PR · 作者 qimcis · 合并时间 2026-05-10 13:38

测试 重要性 5.26 洞察度 3.00

新增 cache-dit 的 1GPU 和 2GPU CI 测试用例

值得合并,建议后续缓存相关变更应确保该测试通过。可考虑进一步增加更多模型或配置的测试以覆盖更广场景。

缺陷修复 重要性 6.62 洞察度 6.00

增强请求转储的鲁棒性与可配置性

建议精读 `tokenizer_manager.py` 中的 `dump_requests`、`_dump_data_to_file` 和 `dump_requests_before_crash` 方法,理解 Pickle 回退的设计模式。值得关注的设计决策是:在出错时只丢弃 `server_args` 而非整体放弃,这是一种优雅的降级方案。

参与讨论