Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 18:46 同步状态:空闲 下次计划:2026-09-02 19:46

PR 列表

更多筛选
2026-05-14
缺陷修复 重要性 7.50 洞察度 4.00

修复PD分离模式下优先级调度静默失效问题

建议阅读此 PR,尤其关注 `_add_request_to_queue` 的控制流调整和 `pop_preallocated` 中排序时机的决策。设计上值得注意的点:将优先级设置与模式分支解耦,以及在索引操作前排序以保证一致性。

#17392 Add BF16 support to EP-MoE for DeepGEMM

原始 PR · 作者 froststeam · 合并时间 2026-05-14 02:06

功能 重要性 8.36 洞察度 5.00

DeepGEMM EP-MoE 新增 BF16 支持

该 PR 值得阅读,尤其对 DeepGEMM wrapper 模式和自定义 Triton kernel 实现感兴趣的同学。设计上延续 FP8 架构,代码模块化清晰。建议关注后续是否添加自动化测试。

功能 重要性 8.90 洞察度 6.00

MLX 后端新增 mlx_q4/q8 即时量化支持

建议精读此 PR,尤其关注以下设计决策:1. 如何通过标记配置类(MlxQuantizationConfig)避免后端代码侵入并行配置架构;2. 如何利用 MLX 元数据在 `_load_model` 中计算内存节省而不强制实例化权重;3. 如何通过 `is_mps()` 条件注册实现平台感知的量化方法集合;4. 测试文件的注册与自动跳过模式,可作为跨平台测试的范式。

#24491 [diffusion] Add performance mode defaults

原始 PR · 作者 mickqian · 合并时间 2026-05-14 00:57

功能 重要性 9.18 洞察度 6.00

扩散模型新增性能模式自动选择

本 PR 的设计模式(ModelDeploymentConfig 契约 + ServerArgsAutoTuner 分段调优)具有很强的借鉴价值,适合多模型部署平台参考。建议仔细阅读 `server_args_auto_tune.py` 和 `model_deployment_config.py` 的实现。Review 中提出的三个问题尚未解决,在后续使用中需要注意相关风险。

2026-05-13

#24890 Port KV Compression V2 from deepseek_v4_dev

原始 PR · 作者 yhyang201 · 合并时间 2026-05-13 22:40

功能 重要性 9.18 洞察度 6.00

移植DeepSeek V4融合KV压缩V2内核到主分支

建议开发团队深入阅读 `compressor_v2.py` 和 `compress.py` 的设计,了解在线 / 离线压缩路径的统一抽象。同时关注 `Compressor` 内部方法暴露导致的耦合问题,未来可考虑通过策略模式或接口抽象进一步解耦。对于正在使用 DeepSeek V4 的团队,应通过全面的集成测试验证 v2 路径的端到端行为。

性能优化 重要性 7.32 洞察度 6.00

为 DeepseekV2MLP 添加 fused SiLU+clamp+FP8 量化路径

值得精读,尤其是 fused 路径的条件判断和与 deep_gemm 的集成方式;注意 review 中关于 transposed 参数命名的讨论,建议后续完善注释。

#24575 [NPU] add zbal support for npu

原始 PR · 作者 ltcs11 · 合并时间 2026-05-13 20:52

功能 重要性 7.81 洞察度 5.00

NPU 后端集成 zbal 零缓冲区加速库

该 PR 值得 NPU 用户和关心内存优化的工程师精读,尤其是 `lazy_init_zbal_gva_mem` 的混合分配策略。建议在合并后补充 NPU 环境下的性能基准测试文档。

#25145 Fix tests for decode radix cache

原始 PR · 作者 ShangmingCai · 合并时间 2026-05-13 20:31

缺陷修复 重要性 3.53 洞察度 2.00

临时禁用不稳定的 NIXL 测试

这是一个紧急止血的临时变更,适合快速合并。建议团队在后续 PR 中优先解决 NIXL 后端稳定性问题,并恢复测试覆盖。

参与讨论