延迟 Frozen-KV MTP 目标池绑定并重置 out_cache_loc
该 PR 修复了关键 bug,设计选择清晰合理(延迟绑定模式已在其他地方验证),值得精读。重点关注 `frozen_kv_mtp_worker_v2.py` 中的延迟绑定模式和 `out_cache_loc` 重置的改动。
SGLang is a high-performance serving framework for large language models and multimodal models.
延迟 Frozen-KV MTP 目标池绑定并重置 out_cache_loc
该 PR 修复了关键 bug,设计选择清晰合理(延迟绑定模式已在其他地方验证),值得精读。重点关注 `frozen_kv_mtp_worker_v2.py` 中的延迟绑定模式和 `out_cache_loc` 重置的改动。
让扩散模型在内存充足时保持辅助组件常驻 GPU
值得精读,尤其是自动内存策略的阈值分层设计和组件常驻/卸载的权衡考量。Review 中的 opt-out 缺陷可作为后续改进方向。
修复未完成请求的 SWA 驱逐边界丢失问题
值得快速合入。该 PR 修复了一个隐蔽的边界条件 bug,修改量小、理由充分,且通过了 review 讨论。推荐阅读 `swa_component.py` 中的 `prepare_for_caching_req` 逻辑演变,以理解 radix cache 的组件化设计。
原始 PR · 作者 Jyothirmaikottu · 合并时间 2026-06-30 00:16
支持 nvidia/LocateAnything-3B 视觉定位模型
值得精读。本 PR 展示了在 SGLang 框架中集成新多模态模型的标准实践:利用已有组件(MoonViT、Qwen2)组装、注册 config/model_type、编写专属图像处理器,并适配多模态数据流水线。其 review 讨论涉及多图像拆分与 custom logit processor 集成的设计权衡,对后来者具有参考价值。特别是 `LocateAnythingBoxGrammarLogitProcessor` 的约束解码状态机实现,可作为自定义 logit 处理的参考范例。
原始 PR · 作者 yctseng0211 · 合并时间 2026-06-29 22:11
AMD CI 缓存挂载改为可选
该 PR 是一个典型的 CI 基础设施优化,设计清晰,通过环境变量控制行为具有良好的可扩展性。值得关注的点包括:`ENABLE_CACHE_HOST` 的多值 case 处理设计、重型任务的筛选逻辑、以及 review 中提到的 AITER 缓存未配置问题。建议阅读 `scripts/ci/amd/amd_ci_start_container.sh` 中 `case` 块的实现,以及 workflow 中添加环境变量的模式。总体变更简单,但为 AMD CI 的缓存策略提供了灵活基础。
修复 NPU 内存池接口签名与 GPU 对齐
可精读,这是一个典型的接口兼容性修复案例,展示了跨硬件后端接口对齐的重要性。
更新 NPU 确定性推理支持状态
该 PR 为常规文档维护,无需深度审查。建议合并以保持文档准确性。
原始 PR · 作者 ShangmingCai · 合并时间 2026-06-29 18:52
为 Qwen3 MoE 添加 PP×CP 和 PP×DP 的 GSM8K 精度测试
建议开发者在修改并行策略相关代码(如调度器、通信层、PP proxy)时,关注此测试的 CI 结果。此 Mixin 模式简洁,值得在其他组合测试中复用。可考虑后续扩展更多模型和评估集以进一步增强覆盖。
参与讨论