Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-06-15
其他 重要性 3.82 洞察度 3.00

修正 NPU 性能分析文档错误并补充约束

建议合并。该 PR 提升了 NPU 性能分析文档的准确性和可用性,对 NPU 用户很有价值。值得注意的设计决策是:将 Note 卡片移动到更合理的章节位置,以及明确参数优先级顺序,这些做法提升了文档的可读性和规范性。

#28279 [NPU] fix ascend_docs

原始 PR · 作者 Hide-on-bushsh · 合并时间 2026-06-15 21:11

文档 重要性 4.55 洞察度 2.00

更新 Ascend NPU 文档:移除 AISBench、升级依赖、修正命令

属于常规文档维护,值得快速通过。注意 review 中指出的 'two tools' 描述残留应确认已修复;若无,应在合并前补充修正。依赖版本升级建议在发布说明中同步标注。

#28277 [NPU] Docs op performance optimize

原始 PR · 作者 McZyWu · 合并时间 2026-06-15 20:28

文档 重要性 4.64 洞察度 4.00

更新 NPU 文档:新增算子性能优化指南并调整 PD 分离示例

建议 PR 阅读者关注 `ascend_npu_operator_performance_optimizing.mdx` 中 msprof 输出字段的解释,这对性能调优有直接帮助;同时注意 `send_request.mdx` 中的 import 问题尚未彻底修复,若直接复制代码需自行添加 `print_highlight` 的 import。PD 分离文档的 MIMO 环境配置可以作为 NPU 部署的参考。

#28204 Optimize causal Conv3d VAE padding

原始 PR · 作者 mickqian · 合并时间 2026-06-15 20:18

性能优化 重要性 8.04 洞察度 5.00

融合因果 Conv3d 的 cat 与 pad 为 Triton 内核,加速 VAE 解码

建议团队阅读本 PR,尤其是如何通过 Triton 融合简单操作来消除小开销,以及设计回退和守护条件的方式。对于未来类似性能优化(如卷积前置处理),可复用此模式。另外,建议为 Triton 内核添加单元测试,提高回归覆盖。

#28295 [DOCS][NPU]Supplementary Notes

原始 PR · 作者 loading66 · 合并时间 2026-06-15 20:06

文档 重要性 3.29 洞察度 2.00

补充 NPU 部署文档的细节说明

这是一个小范围的文档完善 PR,改动清晰且无争议。对于使用 Ascend NPU 的团队成员或用户,建议阅读更新后的文档以获取最新的配置建议。其他开发者可快速合并或忽略。

#28284 Update documentation for Ascend NPU Guide

原始 PR · 作者 longxin9715 · 合并时间 2026-06-15 20:02

文档 重要性 3.10 洞察度 2.00

更新 Ascend NPU 文档:镜像版本、离线方案及参数修正

此 PR 为纯文档更新,建议部署 NPU 的用户阅读更新后的文档,特别是离线部署和参数配置部分。

其他 重要性 4.03 洞察度 2.00

修复 NPU 新模型支持文档格式与内容

该 PR 为纯文档修正,技术洞察价值有限。如果负责 NPU 相关开发或文档维护,可以快速浏览确认格式规范;其他工程师可忽略。

#28223 [NPU] Add MiMo-V2-Flash manual testcases

原始 PR · 作者 iridiumine · 合并时间 2026-06-15 19:57

测试 重要性 4.97 洞察度 3.00

新增 NPU MiMo-V2-Flash 手动测试用例

该 PR 为纯测试补充,对生产代码无影响。值得关注的是测试中使用的 EAGLE 投机解码参数配置,可作为 NPU 上类似模型的参考模板。

参与讨论