Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 17:58 同步状态:空闲 下次计划:2026-09-01 18:58
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-08-10

#34163 fix(vlm): preserve Kimi-K3 GPU JPEG accuracy

原始 PR · 作者 mickqian · 合并时间 2026-08-10 09:42

缺陷修复 重要性 8.79 洞察度 6.00

Kimi-K3 GPU JPEG 解码改走 nvImageCodec fancy 上采样,精度与 PIL 对齐

值得精读。核心看点有三个:一是用第三方 nvImageCodec 替换 torchvision 默认 nvJPEG 行为的思路——通过 `fancy_upsampling` 配置解决 4:2:0 色度重建精度问题的根因定位非常清晰;二是 decoder 池的容量上限设计(2 实例 + LIFO + 创建锁)在并发与 HBM 之间取平衡;三是测试用 fake `nvidia.nvimgcodec` 模块在纯 CPU 环境验证 GPU 解码逻辑,避免 CI 依赖 GPU,是很好的 mock 模式。若你的团队也在做视觉预处理精度对齐,这份 PR 的验证方法论(paired per-sample score matrix + raw-pixel MAE 基准)可以直接复用。

功能 重要性 9.01 洞察度 7.00

MLX 后端支持 gpt-oss:滑动窗口注意力、attention sinks、sm_scale

值得精读。关注三个设计决策:一是“读取时应用窗口 vs 旋转缓存”的取舍——保留完整 KV 并用 banded mask/尾部截断,在 softmax 下数值等价且不破坏 radix 前缀复用,代价是显存冗余,这是很实用的权衡;二是测试防假阳性设计——刻意要求提示词 >128 token 保证窗口真正参与,否则短提示词下窗口层和全注意力输出相同、测试会空过;三是 AOT 内核门控的 fail-safe 策略——宁可回退到 `mx.fast.rope` 也绝不用 vanilla 内核算错 scaled RoPE。做平台后端或注意力系统的人可参考其中的契约设计与测试方法论。

#33630 Add kda replayssm tests

原始 PR · 作者 ispobock · 合并时间 2026-08-10 09:11

测试 重要性 7.92 洞察度 6.00

KDA ReplaySSM 新增 5 组 parity 测试,锁定 gate 与 ring 正确性

值得精读。虽然文件全是测试,但它们展示了高质量内核 parity 测试的设计范式:1) 从原始输入同时驱动双侧,不让任何一侧预先享有 gate 公式;2) 用不同 shape 矩阵(GQA、非 pow2、单请求、padding)钉死索引偏移类 bug;3) 对性能敏感的批量折叠用位级相等而非数值容差;4) 在测试标题中明确记录“该测试在修复前代码上会红”的历史价值。建议后续维护 KDA/ReplaySSM 相关内核的开发者以此为模板补充测试,也建议阅读 `test_kda_replayssm_fold.py` 中 safe gate 与 softplus 的分支设计,这是捕获真实回归的关键。

缺陷修复 重要性 5.77 洞察度 5.00

修复预填图重放残留 track 行导致 conv checkpoint 错乱

值得精读。改动虽小,但包含三类高价值内容:一是 captured graph 读全行、静态缓冲区需哨兵清理的通用模式;二是死代码成因分析(按 token 填充 vs 按 request 填充的语义差);三是作者展示的系统化插桩定位方法(对比 slot 内容、A/B 验证)以及局部 vs 根治修复的取舍思路,可迁移到其他图捕获后端。

BCG 自动捕获默认 warmup 分辨率,单 flag 即可启用

值得精读:改动虽小,但展示了“复用既有默认值解析 + 失败降级 + 日志提示”的组合设计。建议关注两点:一是自动种入的默认分辨率是否总符合部署预期;二是补充覆盖 `_default_bcg_warmup_resolution` 成功与失败分支的集成测试,避免后续回归。

基础设施 重要性 6.21 洞察度 5.00

CUDA 夜测迁移至 runner_config 注册式调度,统一走 `_pr-test-stage.yml`

值得 CI 基础设施负责人精读:该 PR 展示了如何通过 registry-keyed 注册把分散的手写调度收敛为单一执行路径,`scheduled` 输入作为 per-commit 与夜间行为差异的开关设计干净,token 隔离与超时推导的注释含实证依据。对一般功能开发者,只需了解测试注册格式变更即可,不影响业务代码。关注点建议放在迁移完整性和超时预算变化上,可在合并后观察一个周期的 nightly 结果确认无静默丢失。

缺陷修复 重要性 8.56 洞察度 7.00

修复 DSV4 投机 draft>4 时压缩环静默写坏 KV

该 PR 值得精读,尤其适合负责 DeepSeek-V4 压缩注意力、投机解码和 CUDA 内核开发的工程师。值得关注的设计决策:**将回滚保护 pad 从批次的属性改为环的属性**(单一事实来源)、**容量校验放在启动时而非规划器中**(明确职责边界)、**用“逐步骤写满自身扩展区间”归纳证明驻留充分性**(避免多步回放测试的复杂度)、以及**“回归测试必须能在修复前失败”的验证纪律**。

文档 重要性 4.88 洞察度 7.00

技能文档落定 config 种子禁读规则与分形状读取入口

值得精读,尤其关注三点:1)分形状读取的决策映射(bag / `get_parallel()` / 具名访问器 / `configured_*_size()` / runner stamp),这是理解 SGLang 配置架构的钥匙;2)读棘轮测试(`test_global_config_read_ratchet.py`)如何用 AST 收集器把架构约束钉死,以及词法作用域遮蔽的处理;3)“文档评审反哺代码质量”的流程——纯文档 PR 的评审催生了 `sarvam_moe.py` 与收集器的真实修复。若只关心运行时行为,可跳过。

参与讨论