Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 21:57 同步状态:空闲 下次计划:2026-09-02 22:57

PR 列表

更多筛选
2026-07-26
缺陷修复 重要性 5.55 洞察度 4.00

修复 delayed negotiate 导致 prefill 挂起

值得精读。这是一个典型的“缺失上下文导致状态错误”的调度 bugfix,展示了在复杂调度组合下参数传递的重要性。关注点:negotiate_should_allow_prefill 的参数契约与调用方职责划分。建议后续为该场景补充单元测试,防止回归。

测试 重要性 6.59 洞察度 6.00

AMD MI35x 新增 MiniMax-M3 MXFP8 精度测试

此 PR 主要面向 AMD 平台维护者和 CI 配置参考,不涉及推理逻辑变更,无需精读。但测试文件中针对推理模型 chat+thinking 模式的评估方法、环境变量配置等细节值得参考。

缺陷修复 重要性 7.18 洞察度 4.00

修复 SM120 上融合 MHC 门控条件使 opt-in 生效

值得精读。本 PR 展示了如何精细控制硬件特定 kernel 的启用门控,分离独立路径与融合路径的依赖关系。测试用例设计清晰,覆盖了条件矩阵的所有分支。对于维护 DeepSeek-V4 推理性能的工程师是重要的参考案例。

功能 重要性 7.68 洞察度 6.00

允许 custom all-reduce v2 在单 NVLink clique 跨节点使用

该 PR 展示了如何基于硬件拓扑(NVLink fabric clique)做运行时决策,对通信优化场景有参考价值。值得精读其中的 `is_one_nvlink_clique` 设计模式和模板化 AllReduceParams 的性能考量。对于使用 NVL72/MNNVL 集群的团队,此 PR 意义重大。

缺陷修复 重要性 7.16 洞察度 5.00

修复 hybrid SWA 下 hicache-size 重复分配宿主内存

建议精读。此 PR 修复了一个重要的内存分配 bug,逻辑清晰,测试充分,设计简洁。值得关注的设计决策是将 `--hicache-size` 定义为总预算并按设备字节比例拆分,而非分别传递固定值,这与其他相似场景(如 ratio 模式)的设计保持一致。

性能优化 重要性 8.86 洞察度 5.00

使用 llguidance 原生批量掩码填充,替换逐行调用,提升语法解码性能。

值得精读,尤其是 `fill_vocab_mask_batched` 的设计模式——在基类提供默认回退、子类重写为原生批量调用,是性能优化的典型做法。对于后端开发人员,了解 `register_vocab_mask_buffer` 和 `initialize_vocab_mask_buffer` 有助于实现自己的固定缓冲区优化。测试用例 `test_batched_matches_serial` 是验证批处理正确性的好范例。

缺陷修复 重要性 6.92 洞察度 5.00

修复注意力 TP 复制正向的 token 计数定位

该 PR 值得精读,尤其是理解注意力 TP 分片/复制模式下的 token 计数定位机制。设计简洁,通过谓词模式提供扩展点,对后续支持更多注意力分发策略具有参考价值。

参与讨论