Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 23:02 同步状态:空闲 下次计划:2026-09-03 00:02

PR 列表

更多筛选
2026-06-30
缺陷修复 重要性 6.59 洞察度 6.00

延迟 Frozen-KV MTP 目标池绑定并重置 out_cache_loc

该 PR 修复了关键 bug,设计选择清晰合理(延迟绑定模式已在其他地方验证),值得精读。重点关注 `frozen_kv_mtp_worker_v2.py` 中的延迟绑定模式和 `out_cache_loc` 重置的改动。

缺陷修复 重要性 5.98 洞察度 5.00

修复未完成请求的 SWA 驱逐边界丢失问题

值得快速合入。该 PR 修复了一个隐蔽的边界条件 bug,修改量小、理由充分,且通过了 review 讨论。推荐阅读 `swa_component.py` 中的 `prepare_for_caching_req` 逻辑演变,以理解 radix cache 的组件化设计。

#28958 Support nvidia/LocateAnything-3B

原始 PR · 作者 Jyothirmaikottu · 合并时间 2026-06-30 00:16

功能 重要性 9.00 洞察度 7.00

支持 nvidia/LocateAnything-3B 视觉定位模型

值得精读。本 PR 展示了在 SGLang 框架中集成新多模态模型的标准实践:利用已有组件(MoonViT、Qwen2)组装、注册 config/model_type、编写专属图像处理器,并适配多模态数据流水线。其 review 讨论涉及多图像拆分与 custom logit processor 集成的设计权衡,对后来者具有参考价值。特别是 `LocateAnythingBoxGrammarLogitProcessor` 的约束解码状态机实现,可作为自定义 logit 处理的参考范例。

2026-06-29

#29661 [AMD] Sgl-data mount opt-in

原始 PR · 作者 yctseng0211 · 合并时间 2026-06-29 22:11

基础设施 重要性 4.71 洞察度 4.00

AMD CI 缓存挂载改为可选

该 PR 是一个典型的 CI 基础设施优化,设计清晰,通过环境变量控制行为具有良好的可扩展性。值得关注的点包括:`ENABLE_CACHE_HOST` 的多值 case 处理设计、重型任务的筛选逻辑、以及 review 中提到的 AITER 缓存未配置问题。建议阅读 `scripts/ci/amd/amd_ci_start_container.sh` 中 `case` 块的实现,以及 workflow 中添加环境变量的模式。总体变更简单,但为 AMD CI 的缓存策略提供了灵活基础。

测试 重要性 7.50 洞察度 4.00

为 Qwen3 MoE 添加 PP×CP 和 PP×DP 的 GSM8K 精度测试

建议开发者在修改并行策略相关代码(如调度器、通信层、PP proxy)时,关注此测试的 CI 结果。此 Mixin 模式简洁,值得在其他组合测试中复用。可考虑后续扩展更多模型和评估集以进一步增强覆盖。

参与讨论