Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-05 02:29 同步状态:空闲 下次计划:2026-09-05 03:29

PR 列表

更多筛选
2026-06-25
性能优化 重要性 6.90 洞察度 6.00

跳过冗余 -inf 预填充以加速 HIP DSA 预填充

该 PR 体现了通过参数对齐消除冗余计算的典型优化手段,且提供了详尽的基准测试和单元测试验证。对于关注 AMD 平台长上下文推理性能的开发者,值得精读。设计决策值得在其他类似场景中借鉴。

#29253 Add MiMo V2.5 Blackwell vision FA4 recipe

原始 PR · 作者 BBuf · 合并时间 2026-06-25 13:47

功能 重要性 3.79 洞察度 3.00

为 MiMo V2.5 添加 Blackwell Vision FA4 配方

该 PR 是配置修复和文档更新,值得参考其处理多模态后端兼容性问题的方式。

功能 重要性 8.55 洞察度 6.00

支持BF16 LoRA快速路径并修复EP+CUDA图崩溃

建议团队关注 BF16 路径的性能差异,可考虑添加单元测试覆盖数值正确性。该 PR 的二流重叠设计决策(gate_up LoRA 并发的度、down LoRA 保持串行)值得学习,但需注意 CUDA graph 捕获期间的 event 管理。

#27144 Dllm radix cache npu

原始 PR · 作者 wenxuewuhd · 合并时间 2026-06-25 11:44

缺陷修复 重要性 4.95 洞察度 3.00

修复 NPU 上 DLLM 启用 radix cache 时页面大小不同步问题

该 PR 改动极小但修复了关键的一致性问题,建议合并。可快速阅读理解,无需精读全部文件。

#29252 Tune Gemma4 26B-A4B B200 memory recipe

原始 PR · 作者 BBuf · 合并时间 2026-06-25 11:31

documentation 重要性 3.49 洞察度 2.00

调低 Gemma4 26B-A4B 在 B200 上的内存比例

对于部署 Gemma4 26B-A4B 在 B200 上的用户,建议采用此配置;对于其他模型或硬件组合,无影响。

基础设施 重要性 3.21 洞察度 2.00

为 AMD MI35x 添加 ROCm 7.0 夜间 Docker 构建

该 PR 是常规基础设施变更,无技术难度,但为解决 MI35x 实际问题的必要操作。值得关注的是其依赖的基础镜像 `v0.5.10-rocm700-mi35x` 的维护状况。

缺陷修复 重要性 4.53 洞察度 3.00

修复 diffusion LLM 禁用 PP 条件取反

该 PR 变更简单且关键,值得快速合并。建议阅读 `_handle_dllm_inference()` 方法以理解 diffusion LLM 推理下的参数覆盖模式,并检查其他类似 `if not` 模式是否存在类似反转问题。

参与讨论