NPU 支持 GLM-4.5V 并修复 QK Norm 参数传递
建议阅读 glm4_moe.py 中 forward_prepare 的条件分支设计,了解 NPU 后端如何处理 QK Norm 可选的情况。对于其他需要类似支持的模型可复用此模式。
SGLang is a high-performance serving framework for large language models and multimodal models.
NPU 支持 GLM-4.5V 并修复 QK Norm 参数传递
建议阅读 glm4_moe.py 中 forward_prepare 的条件分支设计,了解 NPU 后端如何处理 QK Norm 可选的情况。对于其他需要类似支持的模型可复用此模式。
HiCache 预取自适应剩余可用内存优化
本 PR 是一次针对性的性能优化,逻辑清晰,值得阅读以理解 HiCache 预取流程和内存自适应策略。对于使用 HiCache 的部署场景,该改动能带来实际收益。建议在合并后运行相关测试(如 test_hicache_storage_mooncake_backend)验证无回归。
移除 PD Pause 中冗余的 inflight 处理调用
该 PR 改动简单、风险低,可直接合并。对于从事 disaggregation prefill 或调度器开发的团队成员有一定参考意义,可了解 `process_disagg_prefill_inflight_queue` 的当前语义和调用场景。
修复 PD Disagg 预填充未 finalize 路由专家输出
建议合并。该 PR 修复了一个明确的遗漏 bug,修改量小,逻辑清晰,且已本地验证通过。
文档中 Python 版本要求更新至 3.10+
建议精读,虽然是简单变更,但体现了保持文档与代码同步的重要性,适合作为文档维护的参考案例。
原始 PR · 作者 alisonshao · 合并时间 2026-04-28 06:27
降低 DeepSeek-V3 测试精度阈值至 0.60
建议合入,属于合理的 CI 维护。后续可观察模型精度趋势,必要时引入更鲁棒的评估指标。
修复 EAGLE3 分段 CUDA Graph 下 mm_input 丢失
值得精读:该 PR 修复了一个涉及分段 CUDA Graph 和推测解码交互的边界问题,代码简洁且有明确条件守卫,是理解 SGLang 推测解码与 CUDA Graph 如何协作的良好范例。
修复 Kimi-K2.5 CPU 路径 grid 键名不一致
可快速合并。对于涉及多路径(CPU/GPU)的键名重构,建议统一检查所有路径避免遗漏。
参与讨论