Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-08-07

#33849 [diffusion] gate fast VAE paths by quality

原始 PR · 作者 mickqian · 合并时间 2026-08-07 12:39

功能 重要性 8.72 洞察度 5.00

quality 门控 VAE 快速路径,打通 OpenAI 图像与视频 API

值得精读。核心看点:①用 WeakKeyDictionary 做 nn.Module 级注册表,兼顾对象身份匹配与 GC 友好;②contextmanager 的 previous_enabled 恢复模式让门控可嵌套、异常安全,是请求级开关的干净范式;③_runtime_sampling_quality 把 OpenAI 的 auto 默认值隔离在采样契约之外,是 API 兼容性处理的范例。对要在 diffusion 运行时新增请求级行为开关或维护 OpenAI 兼容入口的开发者有直接参考价值。建议结合 #33818 一起阅读以理解快速路径本体。

缺陷修复 重要性 5.68 洞察度 4.00

修复 MiniMax-H3 Turbo LoRA 2D 权重合并崩溃

值得精读 `slice_lora_b_weights` 的 2D 分片实现,它展示了如何按 `output_sizes`/`output_partition_sizes` 对 fused 权重做 TP 切分;在引入新的 fused LoRA 格式时可复用该模式。整体改动小、文档完整,可作为 LoRA 兼容性修复的参考样例。

重构 重要性 8.42 洞察度 7.00

zimage 与 hunyuanvideo 注意力迁移至 USPAttention,suffix 位级稳定

建议精读。这是 diffusion 分布式注意力收敛的关键一步:`layer.py` 的 `_forward_with_replicated_suffix` 顺序保持实现是“SP 下复制 token 处理”的范本;“fail loudly 而不是静默错误”的守卫设计值得借鉴;parity 测试的契约划分(suffix bitwise、prefix ≤1e-2)是数值稳定性测试的好例子。后续可关注 ring 并行下复制路径的支持。

重构 重要性 7.78 洞察度 6.00

H3 注意力后端准入改为按 packed varlen 能力自证,显式配置冲突 fail closed

值得精读。该 PR 展示了两个可借鉴的设计决策:一是用“实现类是否覆写 `forward_varlen`”这种 introspection 从实现代码自证能力,替代后端名 allowlist;二是把准入校验从 per-request 路径上移到启动期 `validate_server_args`,并通过 fail closed 消除静默降级。阅读时重点关注 `attention_backend.py` 的 `AttentionRequirements` 契约设计与 `selector.py` 的 fail-closed 行为变更边界。

缺陷修复 重要性 6.69 洞察度 4.00

删除冗余 graph 日志,CI 启动清扫无 pid 的 /dev/shm 泄漏族

值得精读 `stale_shm_cleanup.py` 的清扫逻辑:它展示了“依赖执行时机换取无条件删除”这一设计权衡,以及如何用前缀白名单覆盖无法用 pid 追踪的泄漏族。对于 CI 基础设施维护者,这是一个低风险、高收益的可靠性改进。实现直白,测试与源码同步更新,适合作为 CI 自愈逻辑的参考样例。

#33935 Clean GLM-5.2 NVFP4 cookbook

原始 PR · 作者 b8zhong · 合并时间 2026-08-07 11:51

文档 重要性 3.87 洞察度 1.00

清理 GLM-5.2 NVFP4 文档示例冗余参数

不值得精读。该 PR 是 4 行删除的文档清理,但体现了一个有价值的维护原则——文档示例应反映默认行为、避免冗余参数。若要了解 Blackwell 上 `modelopt_fp4` 与 EAGLE 的完整参数组合,此页面仍是很好的参考入口。

缺陷修复 重要性 5.82 洞察度 4.00

修复 Qwen2.5-VL decode 路径对 expand 视图就地写导致的崩溃

值得快速精读(约 10 分钟):该 PR 形象展示了 PyTorch `expand()` 视图的内存共享语义与就地写限制,以及“先加后 expand”的规避模式。值得关注的设计决策是「用广播替代显式 `repeat_interleave`」的组合写法,可推广到其他对 expand/广播张量做增量更新的场景。建议后续排查其他模型编码器中是否存在相同模式(先 expand 再就地更新),一并修复。

功能 重要性 6.10 洞察度 6.00

为进程组新增 group_desc 语义元数据,供诊断工具区分 TP/PP

值得快速精读,尤其关注测试设计:从 mock 断言到真实 new_group 读回的演进,体现了“用实现验证实现”的同义反复陷阱以及回归守卫的正确写法。代码改动本身很小(+7/-1),但作为分布式可观测性元数据约定({group_name}:device/cpu),对后续 NCCL Inspector 等工具链有实际价值。

参与讨论