#47677 [XPU] Add DSpark speculative decoding support for DeepSeek-V4
原始 PR · 作者 majian4work · 合并时间 2026-07-16 08:59
为 DeepSeek-V4 添加 XPU DSpark 投机解码支持
值得精读,特别是 XPU 平台如何复用已有 MHC 自定义算子而非移植 tilelang 的设计决策。注意缺少测试覆盖,建议合并后尽快补充功能测试和性能基准。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 majian4work · 合并时间 2026-07-16 08:59
为 DeepSeek-V4 添加 XPU DSpark 投机解码支持
值得精读,特别是 XPU 平台如何复用已有 MHC 自定义算子而非移植 tilelang 的设计决策。注意缺少测试覆盖,建议合并后尽快补充功能测试和性能基准。
优化DSv4稀疏注意力 prefill 内核约2倍
建议合并。该 PR 以极小的代码改动(+10/-3)实现了显著的性能提升,且经过充分验证(gsm8k 精度达标,E2E 基准测试全面改善)。值得关注的设计决策:手动管理 num_warps 以平衡并行度与同步开销,以及通过移除冗余 mask 来优化软件流水线。
修复本地投机模型名含点号被误判为自定义类路径
该 PR 修复了一个具体且易于复现的配置解析 bug,代码改动量小且逻辑清晰。建议阅读 `vllm/config/speculative.py` 中的 `_is_custom_proposer_path` 方法,其设计可以作为如何稳健判断导入路径的参考。建议后续为该静态方法补充单元测试,以覆盖各种边界情况(如 `None`、URL、含 `/`、合法导入路径、包含点号的本地目录名等),增强代码的健壮性。
原始 PR · 作者 ruikangliu · 合并时间 2026-07-16 08:06
修复 MLA 注意力层 kv_cache_dtype_skip_layers 失效问题
建议精读本 PR:展示了如何在前序特性基础上补充分支覆盖,体现了高代码质量意识。注意 `drakosha` 提及的关联崩溃问题(`kv_quant_mode` 未同步)可能仍需后续修复,建议关联跟踪 issue。
原始 PR · 作者 yewentao256 · 合并时间 2026-07-16 07:40
优化 fused_topk_bias 数据类型转换,性能提升 1.5-2 倍
值得仔细阅读 CUDA kernel 的模板设计技巧——通过设备函数统一索引类型,避免 Python 层拷贝。该模式可推广至其他需要异构类型输入的 kernel 优化。Python 侧逻辑简化也提升了可读性。
原始 PR · 作者 giuseppegrossi · 合并时间 2026-07-16 07:38
添加 giuseppegrossi 到 ROCm 自动 cc 列表
无需精读。该 PR 属于团队协作的常规维护操作,适合快速合并。
原始 PR · 作者 yewentao256 · 合并时间 2026-07-16 07:33
迁移GLM5.2 MoE序列并行到非torch编译路径
值得精读,因为它展示了在非torch compile环境中如何手动管理序列并行的all-gather/ reduce-scatter以及fused norms。关注点:设计者如何通过在Decoder层内检测序列并行状态来避免额外的通信,以及MTP层中显式属性与隐式形状推断之间的权衡。该PR的修改是干净的,但缺少测试是明显弱点。
两阶段 split compressor 优化 DSv4 prefill TTFT
值得精读。此 PR 展示了如何通过 occupancy-targeted split 解决 kernel 级串行瓶颈,设计思路可推广到其他类似 pattern。关键设计决策:split 沿 head 维度无数据依赖、num_splits 动态计算、平台条件编译。
参与讨论