Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 18:31 同步状态:空闲 下次计划:2026-08-20 19:31

PR 列表

更多筛选
2026-05-18
缺陷修复 重要性 7.59 洞察度 5.00

修复 ROCm 上 DeepSeek V4 功能与高并发精度问题

值得所有 ROCm + DeepSeek V4 用户关注。设计决策(AITER 回退、topk 统一入口)对类似平台适配有参考价值。建议阅读 `rocm_aiter_mla_sparse.py` 中的重构细节。

2026-05-17

#42725 [XPU] fix weight scale shape

原始 PR · 作者 zufangzhu · 合并时间 2026-05-17 16:55

缺陷修复 重要性 5.34 洞察度 4.00

修复 XPU FP8 weight_scale 张量形状

建议精读以了解 XPU FP8 后端的参数处理细节。应关注 review 中关于条件不一致的问题,并考虑在后续 PR 中修复:将 weight_scale 的转置放入与 weight 相同的 if 块中,确保两者布局始终同步。

#42710 [MRV2][XPU] add Model Runner V2 log

原始 PR · 作者 zhenwei-intel · 合并时间 2026-05-17 12:15

功能 重要性 4.24 洞察度 2.00

XPU Worker 新增 V2 Model Runner 日志

值得合并。变更简洁、无风险,为 XPU 后端调试提供便利。可作为 V2 Model Runner 迁移状态的一个轻量级 markers。

#41680 Support bf16 for mamba ssm cache

原始 PR · 作者 qizzzh · 合并时间 2026-05-17 08:54

功能 重要性 4.18 洞察度 2.00

Mamba SSM 缓存支持 bf16

该 PR 简单明确,建议合并。后续可考虑补充单元测试验证 `bfloat16` 选项在 Mamba 缓存中的实际可用性。

缺陷修复 重要性 5.59 洞察度 3.00

修复 Qwen3.5-MTP 与 Qwen3-VL MoE 权重加载中参数丢失

这是一个明确且低风险的 bugfix,值得合并。代码虽少,但体现了对数据契约一致性的重视。建议在类似模型(如其他 MoE 模型)中检查是否有相同的调用模式,统一修复以避免遗留。

#41711 [CI/Build] Bump flashinfer to v0.6.11.post2

原始 PR · 作者 arpera · 合并时间 2026-05-17 05:55

基础设施 重要性 6.75 洞察度 7.00

升级 FlashInfer 至 v0.6.11.post2

该 PR 值得合并,但建议在合并后密切关注 MoE 相关模型(如 DeepSeek-V2/V4)的推理质量和性能基准。另外,建议统一 FlashInfer 版本管理策略,避免多个分支维护不同版本。

功能 重要性 9.18 洞察度 6.00

MooncakeStoreConnector 支持磁盘卸载与双模式拓扑

值得精读,特别是磁盘卸载预算拆分策略和双模式配置校验,为后续其他 connector 提供参考。PR 讨论揭示了命名、IPC 隔离等工程权衡,值得学习。

参与讨论