Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 19:08 同步状态:空闲 下次计划:2026-09-01 20:08

PR 列表

更多筛选
2026-08-17
功能 重要性 6.77 洞察度 4.00

prefill CUDA graph 支持模型自定义 input_embeds 宽度

值得快速精读,重点看 `getattr` 默认回退与双处宽度统一的设计决策;建议合并后补一个针对 `_input_embeds_hidden_size` 分支的单元测试,并在模型接入文档中明确 `input_embeds_hidden_size` 的语义,避免未来接入方拼错属性名时静默回退。

功能 重要性 6.73 洞察度 5.00

DSpark 推测解码支持 logprobs 响应

值得精读,尤其是 spec 算法与 logprob 计算的 wiring 模式。重点关注三点:一是 compute_spec_v2_logprobs + 线性接受索引的对齐手法,后续新 spec 算法可直接复用;二是 _linear_accept_indices 的缓存设计,避免热路径重复分配;三是"先拒绝后解锁"的最小改动面——两处拒绝逻辑 + 一处热路径接入就完成能力开放。建议阅读时同时对照 test_basic_sanity_dspark.py 的 compact 模式环境变量,理解测试如何覆盖折叠布局。

基础设施 重要性 9.00 洞察度 6.00

源码检出按需构建 Rust 扩展,统一三 crate 模块命名

值得精读,尤其 loader.py 的指纹缓存、文件锁与原子暂存设计,对构建系统开发者有直接借鉴价值。建议关注两个后续优化点:一是缓存失效以整个 rust 工作区为粒度,可优化为按 crate 依赖子图计算 digest;二是 auto 模式下无 Rust 工具链时直接抛错,可考虑先探测 cargo 可用性并给出更友好的降级提示。

基础设施 重要性 6.26 洞察度 5.00

新增 PR babysitter 启动器并清理 playground 脚本

建议快速浏览 `scripts/playground/launch_pr_babysitters.sh`,重点看两类设计:fetch 后 hash 校验 + 3 次重试(应对 PR head 漂移),以及 worktree 幂等创建/复用(`worktree list`、`show-ref`、`merge --ff-only` 环节)。若团队有自动化 CI 值班需求,这套“skill + tmux + worktree”组合可直接复用。导出脚本移动本身无评审价值。

缺陷修复 重要性 8.88 洞察度 6.00

修复 wrapper 后端共享读取栅栏委托,并按语义重命名 read-end

值得精读。本 PR 是一个典型的数据契约修正 + 调度正确性修复结合体,重点关注:`SharedReadEnds.max_of` 的"按 lateness 聚合"设计如何优雅处理多后端组合;`_replay_attn_backend()` 的统一如何消除 pdmux 下的隐式不一致;以及 `POST_REPLAY` 从"设计状态"重新定义为"未实现标记"这一可审计性思路。测试部分用 `create_autospec` 替代手写 stub 的做法也值得借鉴。

2026-08-16

#35030 Add bit-exact guard for extra_buffer_lazy

原始 PR · 作者 ispobock · 合并时间 2026-08-16 23:34

测试 重要性 6.46 洞察度 5.00

为 extra_buffer_lazy 新增 bit-exact 缓存守卫

值得精读,尤其是关注测试方法论而非实现细节:为什么 `extra_buffer_lazy` 需要独立测试类而不是在现有类上加一个 flag;revert-then-red 如何把「守卫确实能检测缺陷」变成可验证的硬证据;`KL_DIV_THRESHOLD`、`TRACK_INTERVAL`、`PAGE_SIZE`、`MAX_NEW_TOKENS` 等常量如何与模型特性(SWA 窗口、page 边界、chunked prefill)相互绑定。对于想为 speculative decoding、MTP、DSpark 等路线图项补守卫的开发者,这是一个可直接复制的模板。

测试 重要性 5.65 洞察度 4.00

收紧 NVIDIA 基线 1381 项,恢复 Hunyuan3D 全管线覆盖

值得精读,尤其是 PR body 的归因表:它示范了性能基线维护的规范动作——用同一 revision 的连贯测量替换 field-wise 散值、对异常 delta 区分"配置差异"与"真实优化"、剔除失败测量并用重试替代、以独立递归审计校验零上调。对 diffusion CI 维护者,建议关注后续 flaky 情况:若新基线频繁误报,可对尾部敏感场景引入多轮测量取中位数或小幅回退。对性能工程师,turbo_wan/fsdp/ltx 的归因方法(对比内存驻留量、step 时间、模式差异)可直接复用到其他平台基线维护。

#34932 [diffusion] Accelerate Cosmos3 T2I QKNorm+RoPE

原始 PR · 作者 BBuf · 合并时间 2026-08-16 20:15

性能优化 重要性 6.88 洞察度 6.00

Cosmos3 T2I 接入 fused QKNorm+RoPE,B300 提速约 13.4%

值得精读:它展示了如何在性能优化中保住 bit-exact 语义,并用显式守卫(CUDA / 非编译 / 非 SP / `_gen_layers_torch_compiled`)控制路径切换。关注 `can_use_fused_inplace_qknorm_rope` 的 gate 条件以及缓存 dtype 提前收敛的细节,这些是同类优化可复用的模式。

参与讨论