Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-05 02:29 同步状态:空闲 下次计划:2026-09-05 03:29

PR 列表

更多筛选
2026-06-25

#29117 [CPU] optimize GDN prefill performance

原始 PR · 作者 mingfeima · 合并时间 2026-06-25 09:04

性能优化 重要性 7.09 洞察度 6.00

优化CPU GDN prefill性能

值得精读,特别是 `fla.cpp` 中的循环融合策略和 AVX512 优化技巧,对 CPU 推理场景很有参考价值。

重构 重要性 7.54 洞察度 5.00

内联 extend_range 访问器并删除 fill_len/extend_input_len

该 PR 值得仔细阅读,展示了如何安全地进行大规模属性替换,以及如何系统性处理由重构触发的连锁问题。特别是作者使用 Claude Code 协助根因分析的做法值得借鉴。对于技术管理者:可以观察团队在重构中维护 CI 通过率的策略。

#28872 【NPU】adapt_fused_rope_qk_mqa_optimize

原始 PR · 作者 cen121212 · 合并时间 2026-06-25 08:55

缺陷修复 重要性 4.79 洞察度 3.00

NPU fused_rope_qk_mqa 阈值条件修复

建议关注此改动是否引入 NPU 上的精度或性能回归,可通读 fused_rope_qk_mqa 算子实现确认其上限约束。

重构 重要性 7.78 洞察度 7.00

合并 extend_input_len/fill_len 为 Req.extend_range,消除分散赋值

值得精读。该 PR 展示了如何通过强类型消除隐式语义二义性,是 Req 数据结构走向更不可变、更能防御错误的良好模式。推荐跟进后续 PR #27611(内联 property)和 #27616(先决条件)了解完整演进链。

重构 重要性 8.87 洞察度 5.00

清理 IPC 结构体,删除 SenderWrapper,重命名并优化类型

值得精读,尤其是 io_struct.py 和 tokenizer_manager.py 的变更。设计决策上值得关注:如何通过删除包装器、收窄类型、显式绑定点来降低 IPC 层技术债务。可作为后续大规模重构的参考样板。

#29063 Sync the changes in #23402

原始 PR · 作者 b8zhong · 合并时间 2026-06-25 08:01

功能 重要性 4.09 洞察度 4.00

单节点 SM10X 默认使用 MNNVL 后端

该 PR 为小范围性能优化,逻辑简单,对于 Blackwell 用户可快速跟进。值得关注的是,团队依据真实 profiling 数据(CUPTI)做出默认值调整,这是值得学习的性能调优实践。

功能 重要性 6.36 洞察度 5.00

支持非门控MoE在线MXFP8量化并默认使用CUTLASS后端

建议核心推理引擎开发者精读`fp8_utils.py`中`initialize_fp8_gemm_config`的自动后端选择逻辑,理解如何根据硬件和量化类型动态切换GEMM后端。对于MoE模型开发者,`flashinfer_trtllm.py`中非门控权重的对齐处理是一个值得参考的设计模式。后续关注点:需要为非门控MoE添加专用测试,以及考虑在更多硬件上验证CUTLASS后端的性能。

参与讨论