Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-08-29

#36476 [NPU] [DOC] update npu best practice

原始 PR · 作者 amote-i · 合并时间 2026-08-29 09:38

文档 重要性 5.99 洞察度 4.00

更新 NPU 最佳实践文档,新增 V4-Flash 教程与 GLM-5.2 指南

值得精读其中两个新页面(DeepSeek-V4-Flash best-practices 与 tutorial),尤其适合负责昇腾部署的工程师与文档维护者。值得学习的设计决策:以实测数据为准修正文档、删除无法支撑的性能声称;把环境变量收敛为顶层导出并去掉调试开关;在教程里提供 8-die 最小验证配置降低入门门槛;以及用 bot 自动化合并的文档流水线。

缺陷修复 重要性 5.59 洞察度 4.00

修复 DSpark 重复采样,删除多余 sample_block 调用

该 PR 小而精,值得快速合入。它修复了一个隐蔽的逻辑错误,且通过相关测试验证。关注点在于测试覆盖,建议后续补充一个直接针对该路径的单元测试,以防回归。

缺陷修复 重要性 5.86 洞察度 5.00

修复 extra-kwargs 注意力路径丢弃 LSE 输出

值得关注,因为修复了一个图形路径下的功能缺陷,并提供了清晰的测试验证。设计决策上,通过检测 `return_lse` 键和 `mha_return_lse` 标志来决定是否处理 LSE,保持了向后兼容性。

#36828 [AMD] Update v4 amd cookbook 0828

原始 PR · 作者 1am9trash · 合并时间 2026-08-29 08:20

文档 重要性 4.06 洞察度 3.00

更新 AMD DeepSeek-V4 cookbook 镜像与 MoRI EP 配置

该 PR 值得快速浏览,因为它体现了文档如何随功能演进同步更新,特别是为 AMD 用户提供了 MoRI 后端的实用配置。无需精读代码,但值得关注新增环境变量的实际效果。

缺陷修复 重要性 7.63 洞察度 5.00

修复 aiter ASM prefill 在 page_size>1 时 KV 索引错误

值得精读,尤其是对 AMD 注意力内核与 KV 元数据口径感兴趣的同学。核心收益有三点:一是识别出 kv_indptr/kv_indices 的 token 级语义并简化 gather;二是把不可测试的内联逻辑提取为模块级纯函数并补回退日志;三是用随机打乱页面的构造暴露 page_size=1 掩盖边界缺陷的测试设计。

功能 重要性 9.33 洞察度 7.00

新增 AMD 持久 CTA 工作窃取解码注意力内核

值得精读:WCA 的 persistent-CTA + work-stealing + capture-time 决策三个设计点对注意力 kernel 工程很有借鉴价值;建议重点看自动门控在 eager 与 CUDA graph 下的两套决策逻辑,以及 1xCU 网格在 MI300X/MI355X 上的 A/B 验证过程。若团队后续要支持更长上下文或引入更多 AMD 内核,本 PR 的分层(kernel / dispatch / gate / bench / test)是一个很好的模板。

重构 重要性 7.89 洞察度 4.00

重构 JIT 内核与专家打包目录布局

值得快速浏览,了解目录组织模式(ops 与 jit 分离、工具内嵌包)及延迟导入、Git 元数据回退等实用技巧。对于负责打包、部署或维护 JIT 内核的工程师,建议精读 `expert_pack_runtime.py` 和 `minicpm_sala/__init__.py` 的改动。

参与讨论