Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 18:31 同步状态:空闲 下次计划:2026-08-20 19:31

PR 列表

更多筛选
2026-06-17
缺陷修复 重要性 6.17 洞察度 6.00

修复 DP+TP 时 FlashInfer all-reduce 融合死锁

建议尽快合入并标记为 bugfix。变更虽小但涉及并行启动的关键路径,且已有清晰的根因分析。后续可考虑添加持续集成测试覆盖 TP+DP 或 TP+PP 组合的启动验证。

#45831 [Bugfix][PD] Fix DSV4 disaggregated serving

原始 PR · 作者 ZhanqiuHu · 合并时间 2026-06-17 23:17

缺陷修复 重要性 5.14 洞察度 3.00

修复 DSV4 分离式服务 MLA 区域识别

本 PR 属于问题修复,改动量小且精准,建议合并。后续可考虑在相关 spec 类中添加抽象方法(如 `is_mla`)以避免此类遗漏,但当前修复足够。

功能 重要性 7.57 洞察度 6.00

新增 Helion 内核 rms_norm_dynamic_per_token_quant

该 PR 是 Helion 集成项目的重要一步,值得关注其内核设计与自动调优流程。建议在集成前解决冗余计算问题,以确保性能优势。审查者提出的类型提示和注释错误虽不影响功能,但应修复以保持代码质量。适合在相关基础设施就绪后合并入主线。

性能优化 重要性 7.68 洞察度 5.00

DSv4 flashinfer 稀疏索引缓存

值得精读。它展示了一个典型的‘work-avoidance’优化:识别重复计算,用字典替换重复调用,并结合测试验证。对 vLLM 贡献者理解 DeepSeek V4 注意力架构以及性能优化模式很有帮助。

#43853 Feature: Enable Flashinfer non-gated MoE bf16

原始 PR · 作者 amirkl94 · 合并时间 2026-06-17 22:32

功能 重要性 7.01 洞察度 5.00

Flashinfer 非门控 MoE bf16 支持

值得精读。本 PR 展示了在统一 MoE 抽象层中新增非门控支持的典型步骤:能力声明、权重格式适配、后端编排和激活传递。设计决策(如对齐策略)经过 review 讨论,可作为类似扩展的参考。

缺陷修复 重要性 6.26 洞察度 6.00

修复 Quark FP8 权重 scale 标签错误以启用 AITER 预洗牌 GEMM

建议精读此 PR,尤其是讨论中关于 vLLM 内部权重 scale 标签不一致的深入分析。该修复展示了正确的方案:当框架内部表示不统一时,优先在源头改正(采用压缩张量规范),而不是在消费端做兼容 hack。

缺陷修复 重要性 3.36 洞察度 2.00

修复 XPU CI 上 lm-eval 版本不兼容导致的 ImportError

该 PR 是常规的 CI 维护变更,不值得精读。关注点:`requirements/test/xpu.in` 中使用 `>=` 而非固定版本,允许小版本升级,在 CI 中通过显式安装确保最低版本。

参与讨论