修复PD分离模式下优先级调度静默失效问题
建议阅读此 PR,尤其关注 `_add_request_to_queue` 的控制流调整和 `pop_preallocated` 中排序时机的决策。设计上值得注意的点:将优先级设置与模式分支解耦,以及在索引操作前排序以保证一致性。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复PD分离模式下优先级调度静默失效问题
建议阅读此 PR,尤其关注 `_add_request_to_queue` 的控制流调整和 `pop_preallocated` 中排序时机的决策。设计上值得注意的点:将优先级设置与模式分支解耦,以及在索引操作前排序以保证一致性。
原始 PR · 作者 froststeam · 合并时间 2026-05-14 02:06
DeepGEMM EP-MoE 新增 BF16 支持
该 PR 值得阅读,尤其对 DeepGEMM wrapper 模式和自定义 Triton kernel 实现感兴趣的同学。设计上延续 FP8 架构,代码模块化清晰。建议关注后续是否添加自动化测试。
MLX 后端新增 mlx_q4/q8 即时量化支持
建议精读此 PR,尤其关注以下设计决策:1. 如何通过标记配置类(MlxQuantizationConfig)避免后端代码侵入并行配置架构;2. 如何利用 MLX 元数据在 `_load_model` 中计算内存节省而不强制实例化权重;3. 如何通过 `is_mps()` 条件注册实现平台感知的量化方法集合;4. 测试文件的注册与自动跳过模式,可作为跨平台测试的范式。
扩散模型新增性能模式自动选择
本 PR 的设计模式(ModelDeploymentConfig 契约 + ServerArgsAutoTuner 分段调优)具有很强的借鉴价值,适合多模型部署平台参考。建议仔细阅读 `server_args_auto_tune.py` 和 `model_deployment_config.py` 的实现。Review 中提出的三个问题尚未解决,在后续使用中需要注意相关风险。
移植DeepSeek V4融合KV压缩V2内核到主分支
建议开发团队深入阅读 `compressor_v2.py` 和 `compress.py` 的设计,了解在线 / 离线压缩路径的统一抽象。同时关注 `Compressor` 内部方法暴露导致的耦合问题,未来可考虑通过策略模式或接口抽象进一步解耦。对于正在使用 DeepSeek V4 的团队,应通过全面的集成测试验证 v2 路径的端到端行为。
为 DeepseekV2MLP 添加 fused SiLU+clamp+FP8 量化路径
值得精读,尤其是 fused 路径的条件判断和与 deep_gemm 的集成方式;注意 review 中关于 transposed 参数命名的讨论,建议后续完善注释。
NPU 后端集成 zbal 零缓冲区加速库
该 PR 值得 NPU 用户和关心内存优化的工程师精读,尤其是 `lazy_init_zbal_gva_mem` 的混合分配策略。建议在合并后补充 NPU 环境下的性能基准测试文档。
原始 PR · 作者 ShangmingCai · 合并时间 2026-05-13 20:31
临时禁用不稳定的 NIXL 测试
这是一个紧急止血的临时变更,适合快速合并。建议团队在后续 PR 中优先解决 NIXL 后端稳定性问题,并恢复测试覆盖。
参与讨论