Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 23:02 同步状态:空闲 下次计划:2026-09-03 00:02

PR 列表

更多筛选
2026-08-10

LTX-2 新增 quality=high 融合核,去噪提速 5.7% 逼近 torch.compile

值得精读,三个看点:(1)profiling 归因方法——用 kernel-time 归因定位 torch.compile 优势全部来自 elementwise 融合,从而避免盲目上 CUDA graph,方法论可直接复用于其他 compute-bound 模型;(2)quality 门控的精度工程——显式承认 ≤ 1 ULP 差异,用质量档位而非运行时自检管理精度边界,lossless 默认保持 bit-exact;(3)复用与缓存——ones 权重缓存让 weightless RMSNorm 直接复用既有 `fused_rmsnorm_scale_shift_bitexact` 内核。建议后续将 PSNR 验收固化为 e2e CI 测试,并为 QualityGatedFusion handler 家族补充文档。

#34163 fix(vlm): preserve Kimi-K3 GPU JPEG accuracy

原始 PR · 作者 mickqian · 合并时间 2026-08-10 09:42

缺陷修复 重要性 8.79 洞察度 6.00

Kimi-K3 GPU JPEG 解码改走 nvImageCodec fancy 上采样,精度与 PIL 对齐

值得精读。核心看点有三个:一是用第三方 nvImageCodec 替换 torchvision 默认 nvJPEG 行为的思路——通过 `fancy_upsampling` 配置解决 4:2:0 色度重建精度问题的根因定位非常清晰;二是 decoder 池的容量上限设计(2 实例 + LIFO + 创建锁)在并发与 HBM 之间取平衡;三是测试用 fake `nvidia.nvimgcodec` 模块在纯 CPU 环境验证 GPU 解码逻辑,避免 CI 依赖 GPU,是很好的 mock 模式。若你的团队也在做视觉预处理精度对齐,这份 PR 的验证方法论(paired per-sample score matrix + raw-pixel MAE 基准)可以直接复用。

功能 重要性 9.01 洞察度 7.00

MLX 后端支持 gpt-oss:滑动窗口注意力、attention sinks、sm_scale

值得精读。关注三个设计决策:一是“读取时应用窗口 vs 旋转缓存”的取舍——保留完整 KV 并用 banded mask/尾部截断,在 softmax 下数值等价且不破坏 radix 前缀复用,代价是显存冗余,这是很实用的权衡;二是测试防假阳性设计——刻意要求提示词 >128 token 保证窗口真正参与,否则短提示词下窗口层和全注意力输出相同、测试会空过;三是 AOT 内核门控的 fail-safe 策略——宁可回退到 `mx.fast.rope` 也绝不用 vanilla 内核算错 scaled RoPE。做平台后端或注意力系统的人可参考其中的契约设计与测试方法论。

#33630 Add kda replayssm tests

原始 PR · 作者 ispobock · 合并时间 2026-08-10 09:11

测试 重要性 7.92 洞察度 6.00

KDA ReplaySSM 新增 5 组 parity 测试,锁定 gate 与 ring 正确性

值得精读。虽然文件全是测试,但它们展示了高质量内核 parity 测试的设计范式:1) 从原始输入同时驱动双侧,不让任何一侧预先享有 gate 公式;2) 用不同 shape 矩阵(GQA、非 pow2、单请求、padding)钉死索引偏移类 bug;3) 对性能敏感的批量折叠用位级相等而非数值容差;4) 在测试标题中明确记录“该测试在修复前代码上会红”的历史价值。建议后续维护 KDA/ReplaySSM 相关内核的开发者以此为模板补充测试,也建议阅读 `test_kda_replayssm_fold.py` 中 safe gate 与 softplus 的分支设计,这是捕获真实回归的关键。

缺陷修复 重要性 5.77 洞察度 5.00

修复预填图重放残留 track 行导致 conv checkpoint 错乱

值得精读。改动虽小,但包含三类高价值内容:一是 captured graph 读全行、静态缓冲区需哨兵清理的通用模式;二是死代码成因分析(按 token 填充 vs 按 request 填充的语义差);三是作者展示的系统化插桩定位方法(对比 slot 内容、A/B 验证)以及局部 vs 根治修复的取舍思路,可迁移到其他图捕获后端。

BCG 自动捕获默认 warmup 分辨率,单 flag 即可启用

值得精读:改动虽小,但展示了“复用既有默认值解析 + 失败降级 + 日志提示”的组合设计。建议关注两点:一是自动种入的默认分辨率是否总符合部署预期;二是补充覆盖 `_default_bcg_warmup_resolution` 成功与失败分支的集成测试,避免后续回归。

基础设施 重要性 6.21 洞察度 5.00

CUDA 夜测迁移至 runner_config 注册式调度,统一走 `_pr-test-stage.yml`

值得 CI 基础设施负责人精读:该 PR 展示了如何通过 registry-keyed 注册把分散的手写调度收敛为单一执行路径,`scheduled` 输入作为 per-commit 与夜间行为差异的开关设计干净,token 隔离与超时推导的注释含实证依据。对一般功能开发者,只需了解测试注册格式变更即可,不影响业务代码。关注点建议放在迁移完整性和超时预算变化上,可在合并后观察一个周期的 nightly 结果确认无静默丢失。

缺陷修复 重要性 8.56 洞察度 7.00

修复 DSV4 投机 draft>4 时压缩环静默写坏 KV

该 PR 值得精读,尤其适合负责 DeepSeek-V4 压缩注意力、投机解码和 CUDA 内核开发的工程师。值得关注的设计决策:**将回滚保护 pad 从批次的属性改为环的属性**(单一事实来源)、**容量校验放在启动时而非规划器中**(明确职责边界)、**用“逐步骤写满自身扩展区间”归纳证明驻留充分性**(避免多步回放测试的复杂度)、以及**“回归测试必须能在修复前失败”的验证纪律**。

参与讨论