更新贡献与评估指南,对齐最新 CI 与测试流程
值得作为文档维护的样板浏览,重点看'测试注册与本地运行'和'Mintlify 链接检查'两节,它们准确反映了 SGLang CI 的真实行为;若你在维护内核或自定义库(DeepGEMM/DeepEP),新增的工作流章节有直接参考价值。无需精读代码逻辑。
SGLang is a high-performance serving framework for large language models and multimodal models.
更新贡献与评估指南,对齐最新 CI 与测试流程
值得作为文档维护的样板浏览,重点看'测试注册与本地运行'和'Mintlify 链接检查'两节,它们准确反映了 SGLang CI 的真实行为;若你在维护内核或自定义库(DeepGEMM/DeepEP),新增的工作流章节有直接参考价值。无需精读代码逻辑。
原始 PR · 作者 michaelzhang-ai · 合并时间 2026-08-20 13:18
PR 状态块新增 AMD ROCm 7.2 行,不影响门禁
该 PR 值得快速了解,展示了 CI 状态展示的改进思路,但无复杂设计,适合维护 CI 的工程师精读。
允许 W4AFP8 requant 内核处理仅 128 对齐的隐藏维度
值得精读。三个设计点尤其值得学习:一是用 `HAS_K_TAIL: tl.constexpr` 做编译期特化,让完整块路径零开销、尾部路径单独获得掩码;二是测试通过整数输入 + 2 的幂 scale 实现 e4m3 位精确断言,并用哨兵值验证 padding 行不被触碰,测试设计严谨且可复现;三是性能对比方法论(CUDA graph 内计时排除 Python 启动开销、A/B 顺序交错避免首次测量偏差、opcode 与访存宽度对比证明无向量化损失),可直接迁移到其他 Triton 内核变更的评审中。
加载日志按内存类型报告组件权重驻留位置
值得精读。虽然只是日志增强,但 `component_residency_bytes()` 的实现有几个可复用的设计:用 `/proc/self/maps` 区分 file-backed 与 anonymous host 内存、用 storage 指针去重避免扁平 buffer 重复计数、pinned 判断先于 file-backed 判断(因为 CUDA host allocator 背后是命名映射)。对任何需要诊断显存/内存占用的模块都有参考价值。
修复 KimiLinear 模型 XPU 崩溃,回退无 JIT kernel 路径
值得精读的部分是平台 gating 的设计模式:用 `is_xpu()` 把不支持的 kernel 路径整体挡掉并复用既有 fallback(与 CPU/NPU 一致),以及 review 中『修改模型权重契约 vs 在 kernel 调用点适配』的决策——后者是更稳妥的做法。不建议作为架构参考,属于一次性适配;如后续保留该支持,建议补一个 XPU 单元测试或注释文档。
修复 Hopper 上 Cosmos3 T=1 融合回归。
值得精读,因为涉及架构相关性能路径的准入控制,展示了如何在多平台环境下进行特性开关的修复。关注点:平台判断的封装方式、未来是否会对更多架构进行类似控制。
FLUX 对比 CI 改用 canonical residency 选择器
值得快速浏览,作为 diffusion nightly CI 配置维护的参考。可关注 canonical `--component-residency` 参数在 CI 中的实际验证情况,以确认其与 legacy 参数等价。
降低 diffusion 每请求日志噪音,关键消息降级为 debug
此 PR 简单明确,值得快速 review,可作为日志管理的良好实践参考。
参与讨论