Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 21:57 同步状态:空闲 下次计划:2026-08-21 22:57

PR 列表

更多筛选
2026-05-29
缺陷修复 重要性 7.30 洞察度 6.00

修复 DSv4 AITER MoE 权重加载与 shuffle 三大 Bug

建议精读。该 PR 修复了 DeepSeek-V4 在 ROCm 上的关键障碍,并通过一次性能显著提升验证了 AITER FlyDSL MoE 的实用性。尤其值得关注 TP 分片偏移的修正逻辑,以及 AITER 原生 shuffle 函数的对接方式,这为后续其他 MXFP4 后端的同类问题提供了参考。

功能 重要性 9.36 洞察度 8.00

RDNA3 原生 W4A16 内核,fp16/bf16 性能飞跃

值得所有 AMD ROCm 平台开发者精读,尤其关注 C++ HIP 内核实现(标量 dot-product vs WMMA 调度、LDS 双缓冲、LLVM 编译器 bug 变通)和 Python 监听门控模式。对于量化推理优化者,该 PR 提供了一个针对消费级 GPU 极致优化的参考案例。

缺陷修复 重要性 5.06 洞察度 3.00

修复 Step3 模型流水线并行中 residual 的 KeyError

值得合并,修复明确且低风险。建议团队后续为流水线并行的 IntermediateTensors 初始化编写单元测试,防止类似问题在新模型中复现。

测试 重要性 7.60 洞察度 4.00

为 Nixl+SimpleCPUOffload 多连接器添加单元测试

建议开发者查阅本测试了解 MultiConnector 的模拟验证方式,对涉及 Nixl 与 CPU Offload 的贡献者尤其有参考价值。

#43565 [XPU] support MTP of gdn attention

原始 PR · 作者 mayuyuace · 合并时间 2026-05-29 17:10

功能 重要性 6.47 洞察度 5.00

XPU GDN 注意力支持 MTP 推测解码

该 PR 功能明确、改动集中,值得相关开发人员精读。关注的要点: - 如何将推测解码元数据从 attention metadata 提取并传递给底层内核。 - 使用局部变量统一管理内核参数的模式,便于后续扩展。 - 与 CUDA 端同类实现(参考 `qwen_gdn_linear_attn.py`)的对比可加深对跨平台一致性设计的理解。 - 自动化 review 中提出的代码质量建议虽未完全采纳,但可作为后续代码清洁的切入点。

缺陷修复 重要性 4.87 洞察度 2.00

修复 ROCm CI 中 MoRI 单元测试被错误跳过的问题

可供快速合并,无重大问题。建议 CI 相关人员了解变更背景,并关注后续 e2e 测试是否按 PR 描述使用 RDMA 后端。

缺陷修复 重要性 6.72 洞察度 5.00

修复 ROCm AITER cross-attention 共享 KV 缓存布局问题

推荐合并。修正逻辑清晰、变更最小、已通过回归测试。可作为「架构演进中保持后端兼容性」的典型案例精读:展示了在大规模 layout 标准化过程中,如何通过细粒度的条件分支保护混合使用不同布局的共享资源,避免回归。

参与讨论