PD prefill 服务器跳过 spec verify 相关分配
值得精读,尤其是理解复用 draft-head 先例实现显存优化的设计思路。建议后续补充针对 PD prefill 模式的单元测试,覆盖 pool 分配、graph 捕获和 warmup 逻辑。
SGLang is a high-performance serving framework for large language models and multimodal models.
PD prefill 服务器跳过 spec verify 相关分配
值得精读,尤其是理解复用 draft-head 先例实现显存优化的设计思路。建议后续补充针对 PD prefill 模式的单元测试,覆盖 pool 分配、graph 捕获和 warmup 逻辑。
原始 PR · 作者 janbernloehr · 合并时间 2026-08-10 11:45
修复 SM10X 上 MiniMax-M2 NVFP4 的 MoE 后端路由
值得阅读,作为“窄范围修复 + 后端决策前移”的样例。重点看两点:一是如何通过模型级 override 而非全局 fallback 控制爆炸半径;二是 review 中关于 A2A 组合与静默损坏验证的讨论,这些是同类改动容易遗漏的坑。若团队后续在 SM100 上推进 MiniMax 系列,建议先补齐 deepep 组合的显式处理与 #26324 的正确性 probe。
NPU GSM8K 精度测试重试增至 3 次并放宽超时
该 PR 值得快速浏览,不建议精读——它只涉及测试工具与 CI 配置,无运行时逻辑。值得关注的设计点是:用全局 `MAX_RETRY_COUNT` 取代各测试基类的 `max_attempts` 属性,是"单一事实来源"的合理收敛;但 `DATASET_FLUCTUATION` 与 `DATASET_QUESTION_COUNTS` 不同步登记 `gsm8k` 的问题需要后续跟进,否则新增配置形同虚设。对负责 NPU/CI 稳定性的同学,建议顺带检查 `get_max_retries` 的完整实现,确认 GSM8K 重试确实达到 3。
原始 PR · 作者 DarkSharpness · 合并时间 2026-08-10 10:32
c128 核 epilogue 改 2 warp 写回,提速 5%~10%
值得精读,尤其面向 kernel 工程师:① “最少参与 warp 数 + 寄存器折叠”的 epilogue 设计思路可迁移到其他归约密集型核;② 常量收敛为 Config / Trait 的写法是 JIT 多核共存的良好实践;③ 三次 rebase 合流评论是长生命周期内核 PR 如何与 dtype 重构共存的实例。注意点:合入时 CI 并非全绿、且无新增持久化测试,若要在生产环境依赖该 kernel,建议先自行跑 test_c128_v2.py 与 DSV4 精度回归再升级。
原始 PR · 作者 DarkSharpness · 合并时间 2026-08-10 10:31
修复 DSV4 top-k 在 CUDA 13.1+ 丢非 primary rank 输出
值得精读。这是少见的“工具链版本敏感型编译器错误”调试案例:作者系统排除 9 类假设、用 slot-diff 与插桩把根因定位到单一指针变量携带两个地址空间,方法论本身有很高的迁移价值;`__builtin_assume` 作为 load-bearing 约束而非优化提示的用法也值得记录。建议阅读时重点关注 topk_impl.cuh 中两条散射路径的拆分注释、topk_v2.cuh 中 `__builtin_assume` 的依赖说明,以及 v1 模块 `STB_GNU_UNIQUE` 符号合并的分析。后续可跟进 sm_100a 运行时验证与 CI nvcc 版本保护。
speed 模式默认关闭 torch.compile,改为模型 opt-in
值得精读,尤其适合 diffusion 服务维护者。该 PR 是一个小体量但影响全局默认策略的变更:以 E2E 数据推翻「speed 即 compile」的直觉假设,并保留三层优先级(显式参数 > 模型部署配置 > 全局默认)。建议关注 `adjust_based_on_performance_mode` 中「模型 opt-in 且用户未显式传参」的生效条件,以及后续模型逐渐补齐 opt-in 的演进方向。
修复 DCP prefill 的 GQA 映射错乱,GSM8K 恢复至 0.95
值得精读。重点关注 `_forward_extend_dcp` 中 K/V 切片公式的简洁推导(`rank_in_group * tp_k_head_num // world_size` 配合 `max(..., start + 1)` 防空切片),以及 CPU 回归测试用 `FakeDcpGroup` + fake `extend_attention_fwd` 固定“无通信、形状正确、选区正确”三个契约的轻量测试模式。该 PR 也提供了一个很好的静默正确性回归修复范例:作者用精确的精度数据(0.77 vs 0.95)证明 bug、用 DCP1 对照证明无回归、用 TP8/DCP2 扩展拓扑覆盖。
LTX-2 新增 quality=high 融合核,去噪提速 5.7% 逼近 torch.compile
值得精读,三个看点:(1)profiling 归因方法——用 kernel-time 归因定位 torch.compile 优势全部来自 elementwise 融合,从而避免盲目上 CUDA graph,方法论可直接复用于其他 compute-bound 模型;(2)quality 门控的精度工程——显式承认 ≤ 1 ULP 差异,用质量档位而非运行时自检管理精度边界,lossless 默认保持 bit-exact;(3)复用与缓存——ones 权重缓存让 weightless RMSNorm 直接复用既有 `fused_rmsnorm_scale_shift_bitexact` 内核。建议后续将 PSNR 验收固化为 e2e CI 测试,并为 QualityGatedFusion handler 家族补充文档。
参与讨论