Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-06-13

#27724 Bump ray minimum version to 2.55.1

原始 PR · 作者 xyuzh · 合并时间 2026-06-13 11:49

基础设施 重要性 2.90 洞察度 1.00

Ray 最低版本提升至 2.55.1

该 PR 为常规依赖更新,不需深入阅读,但 RDT 支持是值得关注的新特性线索。

重构 重要性 7.19 洞察度 5.00

将共享专家融合检查移至 Quark 配置,并添加精确判断

该 PR 展示了将量化后端特殊逻辑从模型代码中分离的实践,值得关注。虽然改动较小,但 can_fuse_shared_expert 的深度比较设计为可复用模式。建议在类似涉及量化配置判断的场景中参考此方式。

测试 重要性 7.35 洞察度 5.00

为 mem_cache/utils.py 添加 46 个单元测试

此 PR 是单元测试编写的优秀范例,值得参考其如何为工具函数构建轻量级、不依赖环境的测试。团队可在其他核心模块中推广类似模式。重点关注其中 mock 和精确断言的使用。

重构 重要性 8.44 洞察度 4.00

将 EAGLE verify 方法移出 dataclass 变为独立函数

值得精读的设计决策:将 stateless 行为从数据类中分离,符合“组合优于继承”原则,降低了数据类的耦合,提升了可测试性。建议类似模块也采用此模式。

#28076 [perf] remove several h2d sync

原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-06-13 11:30

性能优化 重要性 5.99 洞察度 4.00

移除 CUDA 同步点,优化 tensor 创建延迟

值得合并,这是一个清晰、低风险的优化,遵循了 PyTorch 官方推荐的做法。核心设计决策——在热路径上使用 pin memory 和异步传输——可以推广到其他张量创建上。

#28116 chore: bump tokenspeed_mla 0.1.1 -> 0.1.6

原始 PR · 作者 kpham-sgl · 合并时间 2026-06-13 10:57

性能优化 重要性 3.84 洞察度 4.00

tokenspeed_mla 版本 0.1.1 → 0.1.6

值得合并,性能提升显著且风险低。推荐关注其他使用 tokenspeed_mla 的模型(如 DeepSeek V4)的回归测试结果。

参与讨论