Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-22 00:42 同步状态:空闲 下次计划:2026-08-22 01:42
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-06-18
缺陷修复 重要性 6.20 洞察度 5.00

修复 MiniMax-M3 在 AMD 上的权重加载与 MXFP4 MoE 激活参数传递问题

该 PR 是修复关键加载问题的必要变更,代码简洁且逻辑清晰,值得精读。其中 `packed_modules_mapping` 的设计模式在 vLLM 中具有通用性,可用于其他类似融合权重的模型。此外,审核者 `tjtanaa` 提供的长上下文测试建议值得关注,建议后续补充相关测试。

#45896 [feature] MiniMax-M3-MXFP4 support added

原始 PR · 作者 qli88 · 合并时间 2026-06-18 02:50

功能 重要性 6.60 洞察度 5.00

支持 MiniMax-M3-MXFP4 模型,更新 ROCm MoE 后端

值得精读,设计决策(为特定模型直接修改平台后端选择)需谨慎。建议关注后续修复 PR(由 qli88 承诺),确保 fallback 行为有适当日志和激活量化检查。阅读重点:`select_mxfp4_moe_backend` 的分支调整和 `SWIGLUOAI_UNINTERLEAVE` 激活的实现。

优化 DSV4 CUDA Graph 减少 eager 断点提升 27% TTFT

值得精读。该 PR 展示了如何通过精细化控制 CUDA Graph 断点实现显著性能提升,`is_active()` 动态分支的设计模式对同类优化有借鉴价值。建议关注后续是否将 `maybe_execute_in_parallel` 封装为通用工具函数。

2026-06-17

#45857 [Log] Update deepgemm log

原始 PR · 作者 yewentao256 · 合并时间 2026-06-17 23:34

cleanup 重要性 4.96 洞察度 2.00

更新 DeepGEMM 日志消息文本

作为日常清理变更,无需精读。值得关注的是 PR #37980 之后 deep_gemm 自动安装的进展,以及日志级别调整是否应该保持为 debug 以符合原始设计。

缺陷修复 重要性 6.17 洞察度 6.00

修复 DP+TP 时 FlashInfer all-reduce 融合死锁

建议尽快合入并标记为 bugfix。变更虽小但涉及并行启动的关键路径,且已有清晰的根因分析。后续可考虑添加持续集成测试覆盖 TP+DP 或 TP+PP 组合的启动验证。

参与讨论