Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-06-10

#17260 [Feature] [Ngram spec] Support ngram spec v2

原始 PR · 作者 SYChen123 · 合并时间 2026-06-10 17:46

功能 重要性 9.17 洞察度 7.00

支持 ngram 猜测解码 v2,启用 overlap 调度

**值得精读**:此 PR 展示了如何将 ngram 猜测解码平滑融入现有的 spec v2 overlap 框架,设计决策值得学习,尤其是通过 Mixin 复用 EAGLE 的 pipeline、以及对非连续接受 token KV cache 的移动策略。关注点:`move_accepted_tokens_to_target_kvcache` 的语义、`max_tree_depth` 的动态推导。 **合并后建议**:跟进 `return_logprobs` 支持,并补充 NPU/AMD 测试。

#26347 Support for Zyphra zaya1 model

原始 PR · 作者 ChengYao-amd · 合并时间 2026-06-10 17:44

功能 重要性 9.18 洞察度 8.00

新增 Zyphra ZAYA1 混合模型推理支持

该 PR 设计严谨,值得仔细阅读。重点关注 CCA 状态管理策略、MOD+TP 的混合运算顺序、以及 CCA 头并行实现。测试覆盖全面,为后续引入类似混合模型提供了可参考的范本。

缺陷修复 重要性 5.65 洞察度 5.00

修复 NPU torch.compile 捕获的 monkey-patch 失效 bug

该 PR 值得合并,它是一个针对特定平台(NPU)的精确 bug 修复,修改简洁且安全。关注点:代码评审者应注意到 Python 导入语义的陷阱——`from module import name` 会创建本地引用副本,而 `import module` 允许动态属性访问。这种模式在需要支持 monkey-patch 的场景下尤为重要。

#26083 Implement online nvfp4 quantization

原始 PR · 作者 zianglih · 合并时间 2026-06-10 15:26

功能 重要性 9.18 洞察度 6.00

为 Blackwell GPU 实现在线 NVFP4 MoE 量化

值得精读此 PR,了解如何将加载时量化和运行时激活缩放结合。推荐关注 `NvFp4OnlineConfig` 的设计(复用 ModelOpt 布局)、环境变量控制排除层、以及通过 `temp_set_env` 临时覆盖量化底层数学的实现模式。

#26908 [CI][PD] Add unit tests for nixl backend

原始 PR · 作者 nbarzilie · 合并时间 2026-06-10 14:31

测试 重要性 7.60 洞察度 4.00

为 NIXL 分解控制逻辑添加 CPU 单元测试

此 PR 值得相关开发者精读,特别是其 FakeAgent 设计和 Mock 策略,可作为同类组件单元测试的参考模板。对于不影响分解模块的团队成员仅需了解已添加覆盖即可。

基础设施 重要性 4.68 洞察度 2.00

删除已废弃的文档部署工作流

无需精读。这是一个简单的清理 PR,可以快速批准。但对于关注 CI 成本优化和文档基础设施的团队,值得了解其背景。

#27767 [codex] Update SGLang-Diffusion docs

原始 PR · 作者 mickqian · 合并时间 2026-06-10 14:18

文档 重要性 5.36 洞察度 6.00

重构 SGLang-Diffusion 文档,区分无损/有损优化并更新模型兼容表

对于**文档维护者**,值得精读本 PR 的分类方式和结构,特别是 performance-optimization.mdx 作为调优入口点的设计(区分无损/有损)以及 compatibility_matrix.mdx 的表格化管理方案。对于**开发者**,只需关注更新后的 CLI 参数和优化优先级。无需深入审查。

参与讨论