#27671 Defer DeepGEMM PDL setup to worker init
原始 PR · 作者 merrymercy · 合并时间 2026-06-10 04:52
延迟 DeepGEMM PDL 初始化到 worker 阶段
该 PR 规模小、逻辑清晰,适合快速合并。值得一提的是,它体现了多进程 GPU 编程中一个重要的最佳实践:避免在 fork 之前进行 CUDA 上下文初始化。团队可以参考此模式,检查其他可能在模块导入时初始化 CUDA 的代码。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 merrymercy · 合并时间 2026-06-10 04:52
延迟 DeepGEMM PDL 初始化到 worker 阶段
该 PR 规模小、逻辑清晰,适合快速合并。值得一提的是,它体现了多进程 GPU 编程中一个重要的最佳实践:避免在 fork 之前进行 CUDA 上下文初始化。团队可以参考此模式,检查其他可能在模块导入时初始化 CUDA 的代码。
移动 JIT 内核测试并添加包内注册保护
该 PR 是一项重要的 CI 基础设施改进,建议所有涉及 JIT 内核开发的成员仔细阅读。特别是预提交钩子的设计(复用 `ut_parse_one_file` 确保检测逻辑一致性)值得在其他项目借鉴。建议在合并后监测一段时间的 CI 运行,确保搬迁后的测试都能正确执行。
修复 kimi-k2.5 EAGLE3 MLA 批处理 draft 嵌入计算
建议合入,因为修复了一个静默的正确性错误且改动极小。开发团队可在后续 PR 中补充针对多模态批处理的单元测试。
原始 PR · 作者 michaelzhang-ai · 合并时间 2026-06-10 01:31
修复 ROCm 上 4D per-frame shift 形状处理
该 PR 值得 CI 维护者和 AMD 平台开发者精读。核心价值在于:1) 展示了如何通过平台条件编译修复跨后端差异;2) 揭示了 Triton kernel 在形状假设上的潜在陷阱;3) 提供了清晰的 root cause 分析和测试验证方法。
LTX-2 VAE 解码内存布局优化,Conv3d 加速 ~3.7 倍
值得精读,展示了内存布局优化驱动性能提升的完整实践:从问题定位(conv3d-bound)、设计权衡(自定义 kernel vs 简单 copy_)、自门控实现到加载器精细控制。`_causal_temporal_pad_channels_last` 的 allocate+copy_ 设计是亮点,可复用至其他时序卷积优化。
原始 PR · 作者 yctseng0211 · 合并时间 2026-06-09 23:12
AMD CI 暂时禁用 async-assert 以避免 MXFP4 测试崩溃
这是一个临时修复,建议尽快定位 MXFP4 EAGLE-MTP 路径中 async-assert 的真因,并确保在 AMD 上也能安全启用。PR 本身值得快速合并以恢复 CI 稳定性。
原始 PR · 作者 Kangyan-Zhou · 合并时间 2026-06-09 22:25
sgl-router 新增请求/TTFT/Worker 指标与 Grafana 仪表盘
建议精读该 PR,尤其是 Histogram 泛化、断路器快照和 SSE 首字节钩子的设计。三个设计模式(RAII 守卫、单锁快照、take-only-once 钩子)具有通用借鉴价值。
为chunked prefill添加系统性脚本化测试套件
建议调度器维护者精读`test/registered/chunked_prefill/`中的脚本化测试,理解框架的断言模式;对于其他模块开发者,scripted-runtime框架可以推广到其他子系统的细粒度测试。该PR的测试设计(精确步进+状态断言)值得作为项目测试标准。
参与讨论