Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-04 00:39 同步状态:空闲 下次计划:2026-09-04 01:39

PR 列表

更多筛选
2026-05-22

#26034 Fix SMG service discovery Clippy lint

原始 PR · 作者 mmangkad · 合并时间 2026-05-22 10:51

缺陷修复 重要性 5.20 洞察度 2.00

修复 SMG 服务发现 Clippy 警告

可直接合并。代码量小、改动清晰,且已通过 CI 验证。

缺陷修复 重要性 6.84 洞察度 5.00

多模态数据加载改为非阻塞,修复健康检查卡死

建议精读本 PR,特别是 base_processor.py 中的异步转换模式,可作为类似 event loop 阻塞修复的参考。注意:未来新增子处理器时,需确保调用 await self.load_mm_data()。

#25830 [NPU] Docs op performance optimize

原始 PR · 作者 McZyWu · 合并时间 2026-05-22 09:20

文档 重要性 4.31 洞察度 5.00

新增 NPU 算子性能优化文档

值得 NPU 开发者和性能调试人员精读,特别是 msProf 输出指标解读部分,可快速定位算子瓶颈。

功能 重要性 8.59 洞察度 5.00

默认启用 diffusion 服务预热,优化首次请求延迟

值得合并。该 PR 有效地解决了 diffusion 服务冷启动问题,设计上优先缓存默认负面提示,并提供了合理的 fallback。建议在后续迭代中增加对预热失败的回退机制和更详细的日志。

性能优化 重要性 7.90 洞察度 5.00

复用 Diffusion 动态 LoRA 缓存,减少 reactivation 开销

建议关注 _reactivate_cached_dynamic_lora_layers 的验证逻辑和 set_lora 的分流架构设计,理解快速路径的正确性边界。尤其适合有 LoRA 切换性能瓶颈的团队参考学习。

缺陷修复 重要性 6.08 洞察度 4.00

修复 HybridLinearKVPool 在 chunked prefix cache 中的类型断言错误

该 PR 值得快速合并,修复了一个生产环境可能遇到的崩溃问题,且改动极小(仅 4 行有效代码)。对于团队而言,学到了如何安全地放宽类型约束以支持包装类型。

提前 HiSparseCoordinator 初始化,删除 attention backend 的懒加载属性

建议合并。此 PR 清理了后端初始化中的一个历史遗留问题,符合‘构造时捕获’的设计原则。值得关注的是通过调整初始化顺序来消除懒加载属性的思路。

参与讨论