修复 SMG 服务发现 Clippy 警告
可直接合并。代码量小、改动清晰,且已通过 CI 验证。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 SMG 服务发现 Clippy 警告
可直接合并。代码量小、改动清晰,且已通过 CI 验证。
修复 PR CI 取消工作流的漏洞,覆盖关闭未合并和工作流不完整
对于 CI 维护者值得精读,特别是 `maybe_cancel_for_pr` 函数的处理逻辑和 `gh run list --status` 的使用。
多模态数据加载改为非阻塞,修复健康检查卡死
建议精读本 PR,特别是 base_processor.py 中的异步转换模式,可作为类似 event loop 阻塞修复的参考。注意:未来新增子处理器时,需确保调用 await self.load_mm_data()。
新增 NPU 算子性能优化文档
值得 NPU 开发者和性能调试人员精读,特别是 msProf 输出指标解读部分,可快速定位算子瓶颈。
默认启用 diffusion 服务预热,优化首次请求延迟
值得合并。该 PR 有效地解决了 diffusion 服务冷启动问题,设计上优先缓存默认负面提示,并提供了合理的 fallback。建议在后续迭代中增加对预热失败的回退机制和更详细的日志。
复用 Diffusion 动态 LoRA 缓存,减少 reactivation 开销
建议关注 _reactivate_cached_dynamic_lora_layers 的验证逻辑和 set_lora 的分流架构设计,理解快速路径的正确性边界。尤其适合有 LoRA 切换性能瓶颈的团队参考学习。
修复 HybridLinearKVPool 在 chunked prefix cache 中的类型断言错误
该 PR 值得快速合并,修复了一个生产环境可能遇到的崩溃问题,且改动极小(仅 4 行有效代码)。对于团队而言,学到了如何安全地放宽类型约束以支持包装类型。
提前 HiSparseCoordinator 初始化,删除 attention backend 的懒加载属性
建议合并。此 PR 清理了后端初始化中的一个历史遗留问题,符合‘构造时捕获’的设计原则。值得关注的是通过调整初始化顺序来消除懒加载属性的思路。
参与讨论