Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-22 00:42 同步状态:空闲 下次计划:2026-08-22 01:42
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-05-02
重构 重要性 9.36 洞察度 6.00

抽象 MLA prefill 后端,引入选择机制并移除 cuDNN

建议精读 `vllm/v1/attention/backends/mla/prefill/selector.py` 和 `base.py`,理解后端的注册与选择模式。整个设计值得在 vLLM 其他 attention 层推广。由于可能存在的 regression,更新后需在生产环境充分验证 MLA 模型推理。

功能 重要性 7.97 洞察度 6.00

添加 logprob_token_ids 支持到 V2 模型 Runner

值得精读,特别是 `compute_topk_logprobs` 的 fast/slow path 设计和 `_fill_logprob_token_ids_kernel` 的实现。njhill 的重构也体现了模块化原则。也可以关注 `gemini-code-assist` 的自动化 review 质量。

#40164 [Eval][CI] Add basic mrcr eval to tests/evals/

原始 PR · 作者 mgoin · 合并时间 2026-05-02 00:00

功能 重要性 7.78 洞察度 4.00

新增MRCR长上下文评估到CI测试套件

本 PR 是 vLLM 项目在 CI 中引入长上下文准确度评测的重要起步。值得关注的设计决策包括:前缀门控评分机制(避免模型输出随机前缀作弊)、每针数单独阈值捕捉差异化退化、通过配置文件灵活控制测试参数。建议后续关注该评测在 CI 中的运行稳定性,并考虑扩展更多模型配置。

2026-05-01

#37646 [ROCm][FEAT] AITER Fused Allreduce + RMSNorm

原始 PR · 作者 vllmellm · 合并时间 2026-05-01 23:07

功能 重要性 9.00 洞察度 6.00

在 ROCm 平台通过 AITER 融合 all-reduce 与 RMSNorm,提升推理吞吐

值得精读。该 PR 展示了如何通过 torch.compile 的 pattern matcher 将外部自定义内核无缝集成到 vLLM 的编译图中,同时优雅地处理与 FlashInfer 后端的共存和 CUDA 图捕获。ROCm 团队应关注 compile range 的合理性以及在高并发下的性能表现。关注点设计(`is_applicable_for_range` 与 compile range 的配合)对其他融合 pass 的引入有参考价值。

性能优化 重要性 8.75 洞察度 6.00

ROCm DeepSeek V3.2 MLA 注意力后端深度优化

值得精读:本 PR 展示了 ROCm 平台上高效 MLA 注意力 kernel 的设计模式,包括 tile 策略、metadata 提前构建、融合 kernel 替换等。建议重点阅读 `rocm_aiter_mla_sparse.py` 中的 `_convert_req_index_to_global_index_kernel` 和 `_forward_mla` 实现,以及 `deepseek_v2.py` 中的 ROCm 分支设计。

#41160 [Kernel] Pack output and LSE in DCP A2A

原始 PR · 作者 sungsooha · 合并时间 2026-05-01 21:01

性能优化 重要性 7.24 洞察度 5.00

打包DCP A2A部分输出和LSE,减少NCCL调用

建议精读。本 PR 展示了如何在不改变上层接口的前提下,通过打包通信 payload 显著优化分布式注意力性能。关键设计决策包括:利用头部维度做内部分割实现打包、WorkspaceManager 的集成策略、以及保持 forward 签名不变以兼容现有调用者。关注通信优化的工程师可以此作为参考。

#41445 [kv_offload+HMA][13/N]: Enable HMA support

原始 PR · 作者 orozery · 合并时间 2026-05-01 19:30

功能 重要性 8.12 洞察度 5.00

启用 OffloadingConnector HMA 支持

值得精读,特别是测试框架如何通过 GPUBlock 和 kv_cache_groups 参数模拟多组场景,以及 SupportsHMA 接口的设计模式。

参与讨论