Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 00:08 同步状态:空闲 下次计划:2026-09-03 01:08

PR 列表

更多筛选
2026-08-25

#36246 [AMD] Add Kimi-K2.7-Code-MXFP4 to cookbook

原始 PR · 作者 Emmanuel0612 · 合并时间 2026-08-25 17:37

文档 重要性 5.60 洞察度 4.00

cookbook 新增 Kimi-K2.7-Code MXFP4 部署指南与命令生成器

值得精读 jsx 中 getDynamicItems 与 condition 的联动写法,以及“文档命令与实测运行对齐”的迭代过程;有 MI350X/MI355X 部署需求者可直接采用页面命令。整体为常规文档 PR,不必深入代码审查。

功能 重要性 5.59 洞察度 4.00

HIP 使能 DSA draft_extend CUDA graph 捕获

值得精读,尤其是 CUDA graph 捕获的允许列表设计。这是一个小幅但影响明确的性能优化,展示了如何通过后端隔离和本地导入实现跨平台支持。建议关注后续对 DSA HIP 的测试覆盖和长期稳定性。

缺陷修复 重要性 8.43 洞察度 6.00

GLM-Image 输出按请求尺寸中心裁剪,D32 对齐后复原

值得精读。核心价值在于两点:一是 `dataclasses.replace()` 与 `init=False` 字段的坑及其修复方式;二是以专用 `DecodingStage` 子类承载模型特有后处理的模式,对 diffusion 子系统后续扩展有参考意义。建议 diffusion 管线与 pipeline 架构相关工程师阅读 `glm_image.py` 和 `diffusion_generator.py` 的改动。

#35630 [AMD] Enable Mori-EP on kimi-k3

原始 PR · 作者 RolaoDenthu · 合并时间 2026-08-25 16:48

功能 重要性 7.14 洞察度 5.00

Kimi-K3 支持 MoRI EP 后端,AITER 路径提前返回

值得精读。这个 PR 是理解 SGLang MoE 后端扩展模式的很好样例:kimi_k3.py 的 `_ep_a2a` / `_sp_moe` 谓词展示了 backend 能力抽象如何决定模型的执行布局,mxfp4.py 的 `_apply_aiter()` 提取则体现了“按 dispatch 格式契约在统一入口分流”的设计。建议阅读时重点看 `DispatchOutputChecker.format_is_deepep()` 与 `use_deep_gemm` 分支的对称关系,并留意后续是否有针对 MoRI 的专项测试补充。

#36046 [Diffusion] Load Comfy NVFP4-AWQ text encoders

原始 PR · 作者 mickqian · 合并时间 2026-08-25 15:43

功能 重要性 8.73 洞察度 5.00

支持自动加载 Comfy NVFP4-AWQ 文本编码器

值得精读,尤其是想理解“保留量化存储、按需反量化”这一设计权衡的读者。建议关注三个点:一是 `inspect_comfy_quant_markers` 如何用逐层 marker 验证替代显式量化参数;二是 `ComfyFullPrecisionNvfp4LinearMethod` 故意跳过 `process_weights_after_loading` 以保持可移植性的取舍;三是文档明确不承诺 FP4 加速的诚实表述方式。对扩展其他 Comfy 量化格式的开发者,本 PR 的标记解析与分派模式可以直接借鉴。

缺陷修复 重要性 5.76 洞察度 5.00

修复 MegaMoE pre-dispatch 缩放行步长填充问题

该 PR 值得精读,特别是内核地址计算和校验逻辑,展示了处理外部库非连续布局的通用方案。建议关注后续 DeepGEMM 是否暴露物理步长,以及是否可简化。

功能 重要性 7.45 洞察度 6.00

NPU 上 DSV4 稀疏注意力适配新算子,metadata 移至 host 计算

值得精读:host 侧 metadata 计算与 CUDA graph 捕获/回放下 CPU 镜像的构建策略是核心设计决策,对理解多硬件(NPU/XPU/AMD)后端适配很有价值;randgun 对简化条件的坚持与 vstone-w 对算子的澄清也值得留意。建议阅读时重点关注 CPU 镜像一致性与 sgl-kernel-npu 版本绑定,若要在生产环境启用,建议先补一次 PR 前后性能对比。

参与讨论