Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-04 00:39 同步状态:空闲 下次计划:2026-09-04 01:39

PR 列表

更多筛选
2026-06-10

#25455 [NPU] MiMo-V2-Flash Adaptation

原始 PR · 作者 iridiumine · 合并时间 2026-06-10 09:13

功能 重要性 8.77 洞察度 6.00

在 Ascend NPU 上实现 MiMo-V2-Flash 多 Token 预测推理支持

该 PR 展示了 NPU 后端适配推测解码的完整流程,包括图运行器继承模式、注意力内核迁移、数据结构调整等,设计决策清晰。推荐相关开发者精读新增的 `multi_layer_eagle_draft_extend_npu_graph_runner.py` 以及 `ascend_backend.py` 中的 `forward_mtp` 变化,以了解 NPU 图捕获与 CUDA 图的差异以及 NPU 融合注意力内核的约束。同时 `memory_pool_npu.py` 的缓冲区分离模式也是对 MHA/MLA 混合场景的有益实践。

#25794 Fix Gemma3 ModelOpt kv-scale loading

原始 PR · 作者 janbernloehr · 合并时间 2026-06-10 08:53

缺陷修复 重要性 5.91 洞察度 4.00

修复 Gemma3 ModelOpt KV-scale 加载顺序 bug

该 PR 值得精读,尤其是关注模型加载器中权重名称映射顺序的设计模式。它提供了一个清晰的示例:当存在多种名称变换规则时,需要仔细考虑执行顺序以避免冲突。

测试 重要性 7.60 洞察度 5.00

新增 AST 契约测试防止 bookkeeping 时钟越权修改

此 PR 值得精读,尤其是其使用 AST 静态分析实现契约测试的设计模式,可以推广到其他需要保护关键数据修改点的场景。白名单+计数检查的方式既严格又灵活,值得借鉴。

#27017 fix(schema): update tokens_after_end

原始 PR · 作者 Muqi1029 · 合并时间 2026-06-10 07:52

缺陷修复 重要性 4.38 洞察度 3.00

修复 schema 缓存导致的 reasoning 状态残留 bug

值得合入,修复逻辑清晰。建议后续为 `reasoner_grammar_backend` 添加单元测试覆盖 cached schema 场景,防止回归。

#27453 Remove FlashInfer GB transport workaround

原始 PR · 作者 mmangkad · 合并时间 2026-06-10 07:48

重构 重要性 7.00 洞察度 4.00

移除 GB200/GB300 FlashInfer 传输工作区

该 PR 是典型的临时工作区移除操作,逻辑清晰、测试充分(本地验证)。对于关注 NVIDIA GB 系列平台或 FlashInfer 集成细节的开发者,值得阅读关键源码片段以了解传输通道选择逻辑。建议快速合并。

缺陷修复 重要性 5.29 洞察度 3.00

修复 Gemma4 多模态处理器 token_regex 缺失导致的 prompt 解析错误

该 PR 修复逻辑清晰、代码简洁,值得阅读以理解多模态 token 扩展的处理模式。其设计决策——通过正则表达式的备选分支同时支持新旧格式——是保持向后兼容的通用方法。不过如果时间有限,可直接参考 gemma3.py 中已生效的相同模式,本 PR 仅是对齐遗漏。

#27660 [AMD] Update amd qwen3.5 cookbook

原始 PR · 作者 1am9trash · 合并时间 2026-06-10 07:26

documentation 重要性 4.95 洞察度 2.00

更新 AMD Qwen3.5 部署文档与交互式片段

本 PR 属于常规文档更新,值得 AMD 用户关注。建议审阅时确认: - Docker 镜像标签是否与当前发布版本一致; - `sglang serve` 与 `python3 -m sglang.launch_server` 的选择是否与项目标准一致。

#27721 Add TP server GPU process regression test

原始 PR · 作者 merrymercy · 合并时间 2026-06-10 07:25

测试 重要性 7.60 洞察度 5.00

新增 TP 服务进程 GPU 上下文回归测试

建议精读此测试的实现思路,特别是 `_wait_for_server_gpu_processes` 中的稳定等待策略以及如何利用进程树过滤 GPU 进程;该模式可用于其他与 GPU 资源分配相关的回归测试。

参与讨论