Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 17:58 同步状态:空闲 下次计划:2026-09-01 18:58

PR 列表

更多筛选
2026-08-20
功能 重要性 7.82 洞察度 6.00

DFlash2 选择器支持量化目标 lm_head,mask 尾部保连续

值得精读。核心看点是“mask padding 尾部而非 crop”如何同时解决 flashinfer 连续性约束与 TP 挂起问题,以及“借目标模型既有 CUDA graph 路径证明量化 kernel 可捕获”的推理方式;测试用 fake quant method 和 top-k 契约桩做 mutation-verified 覆盖,方法论也可借鉴。建议重点关注后续 #35580/#35581 对 degenerate-config 的补强。

缺陷修复 重要性 7.08 洞察度 6.00

单卡 diffusion 省约 5 GiB:单 rank 组不再建 NCCL

值得精读。核心设计决策有两点:一是用 backend 选择而非跳过创建来根治 NCCL 的显存预留,因为 torch.distributed.new_group 本身就会触发分配;二是用统一工厂函数收敛 9 处创建点,避免逐个调用点手动判断、漏改。cache-dit 的补丁也展示了“改后端后要重新审视所有裸消费点”的完整思路。阅读时可重点关注 GroupCoordinator 的 world_size == 1 短路机制与 cache_dit_integration.py 的防护逻辑,后续新增并行组时统一走 new_device_group。

缺陷修复 重要性 5.60 洞察度 6.00

在 ROCm 上禁用 NV PTX 位精确 norm 融合,修复 FLUX 预热崩溃。

此 PR 值得精读。它揭示了在跨平台代码中处理不可编译的 PTX 时应使用平台守卫而非依赖 `try/except`,并展示了如何通过测试正确标记平台相关行为。

#35575 Make PR babysitter launcher fork-safe

原始 PR · 作者 merrymercy · 合并时间 2026-08-20 08:48

基础设施 重要性 4.49 洞察度 4.00

修复 PR babysitter 启动脚本的 fork 分支安全

这是一个值得简单浏览的基建类 PR,展示了安全的 git 远程处理技巧。对于负责 CI 或自动化的工程师有参考价值。

功能 重要性 4.77 洞察度 4.00

DSpark 支持自定义 draft worker 类,默认行为不变。

值得快速浏览,作为了解 DSpark 扩展机制的参考。关注点:`draft_worker_cls` 的类型提示和默认值设计,以及未来若新增测试时需覆盖默认路径回归。

功能 重要性 5.51 洞察度 5.00

扩展 MoE 预调度内核,支持超 8192 宽 hidden 维度。

值得精读,尤其是对 CUDA JIT 内核开发者:本 PR 展示了如何用模板特化同时满足“新形状可用”和“旧形状零回归”两种诉求,静态断言约束量化组对齐的思路也可以推广到其它分块内核。建议在合并前或合并后尽快补充覆盖多 chunk 边界的自动化单测,并对真实 DeepSeek MoE 模型做端到端 benchmark 验证。

#30874 chore: bump tilelang to 0.1.12

原始 PR · 作者 elvischenv · 合并时间 2026-08-20 08:01

dependencies 重要性 3.43 洞察度 3.00

升级 tilelang 至 0.1.12 修复 FlashInfer 融合初始化

值得合并,但建议关注升级后 FlashInfer 融合的实测性能。可精读 tile-ai/tilelang#2541 了解根因。

参与讨论