移除 AMD DSv4 Docker 发布任务
值得快速合并,属于常规的 CI 清理。开发者应关注后续是否还有其他依赖于 `publish_dsv4` 的流程。
SGLang is a high-performance serving framework for large language models and multimodal models.
移除 AMD DSv4 Docker 发布任务
值得快速合并,属于常规的 CI 清理。开发者应关注后续是否还有其他依赖于 `publish_dsv4` 的流程。
支持 ngram 猜测解码 v2,启用 overlap 调度
**值得精读**:此 PR 展示了如何将 ngram 猜测解码平滑融入现有的 spec v2 overlap 框架,设计决策值得学习,尤其是通过 Mixin 复用 EAGLE 的 pipeline、以及对非连续接受 token KV cache 的移动策略。关注点:`move_accepted_tokens_to_target_kvcache` 的语义、`max_tree_depth` 的动态推导。 **合并后建议**:跟进 `return_logprobs` 支持,并补充 NPU/AMD 测试。
原始 PR · 作者 ChengYao-amd · 合并时间 2026-06-10 17:44
新增 Zyphra ZAYA1 混合模型推理支持
该 PR 设计严谨,值得仔细阅读。重点关注 CCA 状态管理策略、MOD+TP 的混合运算顺序、以及 CCA 头并行实现。测试覆盖全面,为后续引入类似混合模型提供了可参考的范本。
原始 PR · 作者 DarkSharpness · 合并时间 2026-06-10 16:49
搬迁 mHC 内核测试到标准注册目录
可直接合入。变更清晰、动机明确,且已通过 `1-gpu-h100` 的实际运行验证。建议未来注意避免向顶层 `tests/` 添加文件。
修复 NPU torch.compile 捕获的 monkey-patch 失效 bug
该 PR 值得合并,它是一个针对特定平台(NPU)的精确 bug 修复,修改简洁且安全。关注点:代码评审者应注意到 Python 导入语义的陷阱——`from module import name` 会创建本地引用副本,而 `import module` 允许动态属性访问。这种模式在需要支持 monkey-patch 的场景下尤为重要。
为 Blackwell GPU 实现在线 NVFP4 MoE 量化
值得精读此 PR,了解如何将加载时量化和运行时激活缩放结合。推荐关注 `NvFp4OnlineConfig` 的设计(复用 ModelOpt 布局)、环境变量控制排除层、以及通过 `temp_set_env` 临时覆盖量化底层数学的实现模式。
为 NIXL 分解控制逻辑添加 CPU 单元测试
此 PR 值得相关开发者精读,特别是其 FakeAgent 设计和 Mock 策略,可作为同类组件单元测试的参考模板。对于不影响分解模块的团队成员仅需了解已添加覆盖即可。
删除已废弃的文档部署工作流
无需精读。这是一个简单的清理 PR,可以快速批准。但对于关注 CI 成本优化和文档基础设施的团队,值得了解其背景。
参与讨论