Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 23:02 同步状态:空闲 下次计划:2026-09-03 00:02
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-05-11
性能优化 重要性 6.75 洞察度 5.00

融合算子加速 NPU Wan 推理 2%-10%

该 PR 展示了如何为 NPU 后端添加融合算子路径,具有参考价值。但 review 中的重构建议未被采纳,对于追求高代码质量的团队尤其值得注意。整体改动较小,建议关注其中的模式设计。

#24916 ci: run H20 stage with CUDA 13

原始 PR · 作者 HanHan009527 · 合并时间 2026-05-11 11:18

基础设施 重要性 2.44 洞察度 1.00

H20 CI 阶段默认 CUDA 版本升级至 13.0

该 PR 为简单的 CI 配置修复,无需精读代码。但体现了团队维护 CI 环境同步的务实做法,对于关注 CI 稳定性的读者有参考价值。

基础设施 重要性 5.01 洞察度 2.00

为 AMD 夜间测试增加 VRAM 清理步骤

建议合并此 PR。它是 CI 质量的常规维护,与 PR 测试工作流的行为对齐,能有效提升夜间测试的可靠性。对于需要维护 CI 管线的团队,本 PR 的改动模式(在容器启动前清理 VRAM)值得在其他类似场景(如共享 runner 的多租户环境)中参考。

缺陷修复 重要性 3.49 洞察度 5.00

为 AMD CI lmms-eval 安装增加重试与安全目录

建议精读此 PR,它展示了处理 CI 中网络瞬态故障和 git 权限问题的典型模式。`git_clone_with_retry` 和 `docker cp` + `safe.directory` 的组合可复用于类似场景。

缺陷修复 重要性 5.71 洞察度 3.00

NPU MTP warmup 因 padding token 维度不匹配崩溃修复

值得合入,修复明确且验证充分。review 中的建议(使用 `forward_batch.batch_size`)可作为后续优化参考,但不影响当前正确性。

#20177 [NPU]adapt multibatch fia ops

原始 PR · 作者 McZyWu · 合并时间 2026-05-11 09:44

性能优化 重要性 6.53 洞察度 5.00

NPU FIA 算子多批处理优化,替代逐序列循环

建议阅读该 PR,了解 NPU 注意力优化如何利用 CANN 多 batch 特性。关注 fia_mask 硬编码问题,后续可能需要提 PR 修复。设计决策——用 TND 布局替换 BSND 并处理 padding——值得参考。

缺陷修复 重要性 6.05 洞察度 5.00

修复 NPU 推测解码中 mrope_position 竞态条件

值得精读。展示了异步流竞态修复的典型模式:在等待流同步后重新计算依赖值,并正确同步到 CUDA graph buffer。对理解 speculative decoding 中的流管理和 CUDA graph 缓冲有参考价值。

参与讨论