#21370 Update skip condition for TestQwen35PPAccuracy
原始 PR · 作者 ShangmingCai · 合并时间 2026-03-25 14:28
更新 TestQwen35PPAccuracy 跳过条件以解决 H100 和 AMD 上的精度回归导致的 CI 阻塞。
建议快速浏览以了解 CI 稳定性维护的临时策略,重点关注跳过条件变更背后的权衡决策。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 ShangmingCai · 合并时间 2026-03-25 14:28
更新 TestQwen35PPAccuracy 跳过条件以解决 H100 和 AMD 上的精度回归导致的 CI 阻塞。
建议快速浏览以了解 CI 稳定性维护的临时策略,重点关注跳过条件变更背后的权衡决策。
原始 PR · 作者 alisonshao · 合并时间 2026-03-25 13:56
修复 disaggregation 测试中 RDMA 设备映射错误,避免 CI 失败。
对于涉及 disaggregation 测试和 RDMA 配置的工程师,建议精读此 PR。关注 _validate_ib_devices 函数中错误处理的设计决策,以及 _pick_default_pair 中相对索引映射的实现细节,这些对于理解 GPU-RDMA 设备映射逻辑至关重要。
MoRI EP 自动从 MoE 权重 dtype 检测 dispatch quantization 类型,简化用户配置。
建议精读 `moriep.py` 中的 `set_quant_config` 和懒初始化设计,以理解如何实现自动检测和延迟创建 MoRI 操作,这对于学习量化路径选择机制和 AMD MoE 优化有价值。
原始 PR · 作者 kkHuang-amd · 合并时间 2026-03-25 13:38
为 AMD 平台的多头注意力添加 FP8 KV 缓存支持,提升推理性能。
建议关注量化优化和注意力机制的开发者精读此 PR。值得关注的设计决策包括:在 forward_extend 中保持 q 精度为 bf16 或 fp16 以优化性能(如 commit 消息所述),以及如何传递缩放因子处理 fp8 缓存。此外,应注意 review 中讨论的未解决问题,如原生 decode kernel 支持。
修改KV缓存数据类型设置,临时绕过B200 GPU启用DP时的性能下降。
建议性能优化工程师精读此PR,了解workaround的设计权衡,同时关注后续根本修复(Issue #21011)以保持代码简洁。对于处理类似硬件性能问题的开发者,此变更提供了临时调整默认配置的范例。
修复 CI 取消工作流程标签错误,确保 bypass-maintenance 标签生效。
此 PR 变更简单,无需深入精读。对于 CI 维护者,值得关注标签命名的一致性,以避免类似错误;对于其他工程师,可作为小规模 bugfix 的参考。
添加 CI 取消工作流程的高优先级 PR 取消选项,优化资源管理。
由于变更较小且无争议,无需精读整个 PR;值得关注的点是 CI 工作流中参数传递和标签检查的实现模式,可作为类似优化的参考。
修复 disaggregation 测试中的 bootstrap 端口冲突,避免 CI 失败。
对于测试维护者和 CI 工程师,建议快速浏览以了解端口配置模式;对于其他开发者,变更简单,无需深度关注。
参与讨论