Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 21:09 同步状态:空闲 下次计划:2026-09-03 22:09

PR 列表

更多筛选
2026-06-13
测试 重要性 7.35 洞察度 5.00

为 mem_cache/utils.py 添加 46 个单元测试

此 PR 是单元测试编写的优秀范例,值得参考其如何为工具函数构建轻量级、不依赖环境的测试。团队可在其他核心模块中推广类似模式。重点关注其中 mock 和精确断言的使用。

重构 重要性 8.44 洞察度 4.00

将 EAGLE verify 方法移出 dataclass 变为独立函数

值得精读的设计决策:将 stateless 行为从数据类中分离,符合“组合优于继承”原则,降低了数据类的耦合,提升了可测试性。建议类似模块也采用此模式。

#28076 [perf] remove several h2d sync

原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-06-13 11:30

性能优化 重要性 5.99 洞察度 4.00

移除 CUDA 同步点,优化 tensor 创建延迟

值得合并,这是一个清晰、低风险的优化,遵循了 PyTorch 官方推荐的做法。核心设计决策——在热路径上使用 pin memory 和异步传输——可以推广到其他张量创建上。

#28116 chore: bump tokenspeed_mla 0.1.1 -> 0.1.6

原始 PR · 作者 kpham-sgl · 合并时间 2026-06-13 10:57

性能优化 重要性 3.84 洞察度 4.00

tokenspeed_mla 版本 0.1.1 → 0.1.6

值得合并,性能提升显著且风险低。推荐关注其他使用 tokenspeed_mla 的模型(如 DeepSeek V4)的回归测试结果。

性能优化 重要性 8.46 洞察度 6.00

熔合 MoE finalize 与 shared add,提升 DeepSeek V3 推理性能

值得精读。该 PR 展示了如何通过推迟并融合算子来减少核启动开销,是典型的 LLM 推理优化模式。重点关注其使用 ContextVar 控制 deferred finalize 的设计,以及新 CUDA 核与 TVM JIT 的集成方式。后续可跟踪其正确性验证进展。

参与讨论