#22381 [Lora] Lora kimi support
原始 PR · 作者 yushengsu-thu · 合并时间 2026-04-10 13:31
为Kimi-K2.5模型添加LoRA支持,并优化量化MoE兼容性。
建议技术管理者和工程师精读此PR,关注LoRA与量化MoE集成的设计决策,如get_triton_quant_info的重构和运行器后端选择逻辑,这些对于理解框架扩展机制有价值。同时,注意review中未解决的风险点,可能在后续开发中需要额外测试或修复。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 yushengsu-thu · 合并时间 2026-04-10 13:31
为Kimi-K2.5模型添加LoRA支持,并优化量化MoE兼容性。
建议技术管理者和工程师精读此PR,关注LoRA与量化MoE集成的设计决策,如get_triton_quant_info的重构和运行器后端选择逻辑,这些对于理解框架扩展机制有价值。同时,注意review中未解决的风险点,可能在后续开发中需要额外测试或修复。
修复SWA驱逐边界bug,防止页面大小大于滑动窗口时radix树插入错误导致的负使用和双重释放。
建议精读以了解SWA驱逐边界处理的预防与防御设计模式,这对于分布式缓存系统有借鉴意义。关注`_evict_swa`和`_insert_helper`的协同修复方式。
修复EAGLE推测解码在TP>1和非贪婪采样时因浮点非确定性导致的NCCL AllGather死锁问题。
该PR是解决分布式推测解码死锁问题的关键修复,值得所有涉及分布式推理和推测解码的工程师精读。重点关注浮点非确定性在分布式采样中的影响,以及通过广播确保一致性的设计模式。
原始 PR · 作者 alisonshao · 合并时间 2026-04-10 11:32
移除ci-auto-bisect工作流中的Slack通知步骤,简化CI通知流程。
此PR变更简单直接,无需深入精读。值得关注的点是CI通知流程的简化决策,体现了从多渠道通知向集中化仪表板的演进趋势。建议团队确认仪表板访问便捷性和可靠性。
原始 PR · 作者 alisonshao · 合并时间 2026-04-10 11:31
更新64个CI测试的估计时间,基于实际耗时优化分区平衡。
对于一般工程师,此PR无需精读,除非关注CI优化方法。值得注意的决策是使用严格标准(≥2数据点且≥50%差异>60s)来确保更新可靠性,可借鉴于类似估计调整场景。
原始 PR · 作者 Kangyan-Zhou · 合并时间 2026-04-10 11:04
为 gRPC 模式新增 Prometheus metrics HTTP 端点,默认端口为主端口加一。
对于关注可观测性、gRPC 集成或 Prometheus metrics 的开发者,建议精读 `_start_metrics_server()` 函数的实现,特别是错误处理和资源管理部分。设计决策如使用 OpenMetrics 格式和 try/except 包装整个 metrics 初始化值得学习。
为Kimi K2.5视觉语言模型添加Encoder-Prefill-Decode (EPD) 解耦支持,扩展多模态推理架构。
建议技术管理者精读此PR,以理解EPD架构的扩展机制和模型特定适配模式,关注设计权衡。工程师可重点关注 `encode_server.py` 中的属性处理逻辑和 `kimi_k25.py` 中的条件初始化策略,作为处理类似多模型支持时的参考案例。
修复非 x86 平台构建错误,将 AVX512 专用结构体包装在条件编译宏内。
该 PR 变更简单直接,适合快速浏览以了解跨平台构建问题的典型修复模式。值得关注的是讨论中提到的 ARM CI 引入计划(PR #22123),这反映了团队在提升跨平台测试覆盖方面的持续投入。
参与讨论