Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 19:08 同步状态:空闲 下次计划:2026-09-01 20:08

PR 列表

更多筛选
2026-08-28
基础设施 重要性 6.06 洞察度 5.00

新增 ROCm 10 发布镜像与 CI 流程,支持 gfx942/gfx950

值得关注 Dockerfile 中 rocm1000-base 阶段的 wheel-based 栈组装方式,以及发布工作流中按架构隔离 device wheels 的设计。这是基础设施演进,对 AMD 社区用户有实际价值,但不涉及核心算法,精读优先级中等。

#36827 [Docs] Add GLM-5.3 cookbook

原始 PR · 作者 Fridge003 · 合并时间 2026-08-28 22:56

文档 重要性 7.59 洞察度 4.00

新增 GLM-5.3 部署 cookbook,含多硬件实测数据

值得精读。虽然是文档变更,但它的数据治理方式很有参考价值:如何用 match 元组把 benchmark 与部署单元格绑定、如何用 verified/experimental/pending 表达数据可信度、如何用环境变量说明隔离“机制验证”与“正确性”数据。对部署工程师,建议直接使用 cookbook 中的 FP8 配方,但注意版本绑定与 NVFP4 的 Experimental 标注;对文档维护者,建议先同步 PR body 与内容的差异,并考虑为旧 benchmark 数据增加“于某版本失效”的提示。

功能 重要性 9.18 洞察度 6.00

新增 GLM-Image 分布式推理拓扑:AR 与 DiT 分角色 fan-out

值得精读。该 PR 展示了如何在既有 N:M:K 解耦编排器中并行走第二条 fan-out 调度模式:两段队列 + ThreadPoolExecutor 重叠 AR/denoiser、ZMQ monitor 驱动 worker 生命周期、n>1 拆分-顺序执行-合并的数据契约,都是可借鉴的设计。建议重点关注超时/断连恢复与共享 batch 属性访问的健壮性是否在后续 PR 中补齐,并为外部 AR 服务的 batching 语义变化补充回归基线。

重构 重要性 9.18 洞察度 7.00

扩散模型 API 参数按模型作用域收敛,杜绝跨模型字段泄漏

值得精读。核心价值在于:1. 如何在通用 OpenAI 兼容端点和模型专属参数之间建立‘声明式契约’,避免字段泄漏;2. request_extra_value 统一了多种 transport 容器(extra_body / extra_json / extra_args / extra_params)的读取优先级;3. 模型默认输出格式也通过 default_image_output_format 下放到子类。对需要扩展 SGLang diffusion API 的工程师,这份契约设计可作为参考模板。

#36759 bugfix for index_fill_ on NPU

原始 PR · 作者 sigama-w · 合并时间 2026-08-28 17:41

缺陷修复 重要性 5.94 洞察度 5.00

NPU 上修复 index_fill_ 性能问题,改用直接赋值

该 PR 值得关注,尤其是 NPU 平台性能优化思路。其核心设计决策是平台分支处理性能敏感操作,并通过基准测试验证收益。建议在合并前补充针对 NPU 的单元测试,覆盖 `clear_full_to_swa_mapping` 的边界情况,确保长期稳定性。

#35677 fix(cpu): skip GPU JIT MoE top-k on CPU

原始 PR · 作者 xinguozhu-2026 · 合并时间 2026-08-28 17:31

缺陷修复 重要性 5.44 洞察度 4.00

CPU 跳过 GPU JIT MoE top-k,修复 CPU MoE 推理崩溃

值得快速阅读:这是一个典型「后端误入 GPU-only 路径」的最小修复范本,改动仅 6 行,评审讨论体现了支持边界的取舍。建议 CPU 维护者关注 review 中关于非 AMX CPU 支持范围的决策,并后续补充自动化测试与非 AMX CPU 性能评估。

缺陷修复 重要性 6.08 洞察度 3.00

XPU 上延迟导入 tvm_ffi 相关 all_reduce 内核,修复 MiniMax M2 模型加载崩溃

该 PR 简单且低风险,值得快速合并。不建议精读,但可关注 XPU 平台支持的类似模式,作为后续其他模型在 XPU 上兼容性修复的参考。

参与讨论