Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 22:27 同步状态:空闲 下次计划:2026-09-03 23:27

PR 列表

更多筛选
2026-06-26
基础设施 重要性 5.39 洞察度 3.00

新增 AMD MI350X 夜间测试 workflow

对于 CI 运维和 AMD 平台关注者,建议精读此工作流的镜像解析和矩阵策略设计,可作为类似硬件覆盖的模板。对于一般开发者,只需了解新的夜间测试流程存在即可,无需深入阅读。

缺陷修复 重要性 6.18 洞察度 5.00

修复 NPU 上 mllama 交叉注意力崩溃问题

该 PR 值得关注,因为它展示了在支持不同注意力模式(自注意力 vs 交叉注意力)时,如何小心处理通用逻辑中的特殊分支。对于类似场景,建议增加单元测试以覆盖多种注意力组合,防止未来回归。

#29265 fix: batch BlockRemoved events per radix node

原始 PR · 作者 PeaBrane · 合并时间 2026-06-26 16:13

性能优化 重要性 6.24 洞察度 5.00

批量radix节点删除事件,降低网络开销

值得精读,尤其是事件设计的权衡:批量 vs 离散。对理解 SGLang KV 事件机制和 radix 缓存清除逻辑有帮助。核心变更简单但经过充分验证,可放心合并。

性能优化 重要性 7.07 洞察度 6.00

交换双流 MoE 中主/备流分工,路由专家改在主流执行

值得精读,特别是对 CUDA 双流调度和 MoE 执行优化的团队。设计决策清晰(流 assignment 的权衡),且有 profile 数据支撑。建议关注 torch.compile 兼容性风险。

功能 重要性 9.36 洞察度 7.00

新增 JoyEcho 多镜头音视频生成支持

值得精读。JoyEcho 的内存银行设计和 DMD 去噪流程是典型的视频生成模型实现示例,对于需要实现类似多镜头机制的开发者有参考价值。SP 处理中对复制前缀与分片后缀的 attention 处理方式(避免 all_gather)也值得关注。建议后续跟踪该 PR 引入的新模型路径的稳定性,以及社区对多镜头生成的支持反馈。

功能 重要性 6.83 洞察度 5.00

为 GLM-5.2 部署文档添加 NVFP4 量化选项,限定 B300/GB300

值得阅读 `_deployment.jsx` 的镜像键解析变更,这是一个从简单键到复合键的演进,提高了灵活性。GLM-5.2 页面的 cell 设计(TP4、EAGLE 参数等)也可作为 Blackwell Ultra 部署的参考。

性能优化 重要性 8.98 洞察度 5.00

为 Cosmos3 添加 CUDA cat/pad 快速路径,提速 ~2x

值得精读。重点关注 `causal_conv3d_cat_pad.py` 中的自定义 op 注册与 fake_impl 设计,以及 `parallel_conv.py` 中的 fallback 模式。该 PR 展示了 JIT 内核与 `torch.compile` 兼容的典型集成方案,对后续扩散模型优化有参考价值。

参与讨论