Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 23:33 同步状态:空闲 下次计划:2026-09-04 00:33

PR 列表

更多筛选
2026-06-15
缺陷修复 重要性 5.99 洞察度 5.00

修复 EAGLE3 多模态 chunked-prefill crash

该 PR 是一个精准的定点 bugfix,改动量小,逻辑清晰,值得精读以理解多模态与 speculative decoding 交互时的边界情况。设计决策中值得关注的是:不对占位符 token 做硬编码过滤,而是依赖 `vocab_size` 作为通用判据——既简洁又与模型无关。

其他 重要性 3.82 洞察度 3.00

修正 NPU 性能分析文档错误并补充约束

建议合并。该 PR 提升了 NPU 性能分析文档的准确性和可用性,对 NPU 用户很有价值。值得注意的设计决策是:将 Note 卡片移动到更合理的章节位置,以及明确参数优先级顺序,这些做法提升了文档的可读性和规范性。

#28279 [NPU] fix ascend_docs

原始 PR · 作者 Hide-on-bushsh · 合并时间 2026-06-15 21:11

文档 重要性 4.55 洞察度 2.00

更新 Ascend NPU 文档:移除 AISBench、升级依赖、修正命令

属于常规文档维护,值得快速通过。注意 review 中指出的 'two tools' 描述残留应确认已修复;若无,应在合并前补充修正。依赖版本升级建议在发布说明中同步标注。

#28277 [NPU] Docs op performance optimize

原始 PR · 作者 McZyWu · 合并时间 2026-06-15 20:28

文档 重要性 4.64 洞察度 4.00

更新 NPU 文档:新增算子性能优化指南并调整 PD 分离示例

建议 PR 阅读者关注 `ascend_npu_operator_performance_optimizing.mdx` 中 msprof 输出字段的解释,这对性能调优有直接帮助;同时注意 `send_request.mdx` 中的 import 问题尚未彻底修复,若直接复制代码需自行添加 `print_highlight` 的 import。PD 分离文档的 MIMO 环境配置可以作为 NPU 部署的参考。

#28204 Optimize causal Conv3d VAE padding

原始 PR · 作者 mickqian · 合并时间 2026-06-15 20:18

性能优化 重要性 8.04 洞察度 5.00

融合因果 Conv3d 的 cat 与 pad 为 Triton 内核,加速 VAE 解码

建议团队阅读本 PR,尤其是如何通过 Triton 融合简单操作来消除小开销,以及设计回退和守护条件的方式。对于未来类似性能优化(如卷积前置处理),可复用此模式。另外,建议为 Triton 内核添加单元测试,提高回归覆盖。

#28295 [DOCS][NPU]Supplementary Notes

原始 PR · 作者 loading66 · 合并时间 2026-06-15 20:06

文档 重要性 3.29 洞察度 2.00

补充 NPU 部署文档的细节说明

这是一个小范围的文档完善 PR,改动清晰且无争议。对于使用 Ascend NPU 的团队成员或用户,建议阅读更新后的文档以获取最新的配置建议。其他开发者可快速合并或忽略。

#28284 Update documentation for Ascend NPU Guide

原始 PR · 作者 longxin9715 · 合并时间 2026-06-15 20:02

文档 重要性 3.10 洞察度 2.00

更新 Ascend NPU 文档:镜像版本、离线方案及参数修正

此 PR 为纯文档更新,建议部署 NPU 的用户阅读更新后的文档,特别是离线部署和参数配置部分。

其他 重要性 4.03 洞察度 2.00

修复 NPU 新模型支持文档格式与内容

该 PR 为纯文档修正,技术洞察价值有限。如果负责 NPU 相关开发或文档维护,可以快速浏览确认格式规范;其他工程师可忽略。

参与讨论