Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 19:35 同步状态:空闲 下次计划:2026-08-21 20:35

PR 列表

更多筛选
2026-06-17
缺陷修复 重要性 6.26 洞察度 6.00

修复 Quark FP8 权重 scale 标签错误以启用 AITER 预洗牌 GEMM

建议精读此 PR,尤其是讨论中关于 vLLM 内部权重 scale 标签不一致的深入分析。该修复展示了正确的方案:当框架内部表示不统一时,优先在源头改正(采用压缩张量规范),而不是在消费端做兼容 hack。

缺陷修复 重要性 3.36 洞察度 2.00

修复 XPU CI 上 lm-eval 版本不兼容导致的 ImportError

该 PR 是常规的 CI 维护变更,不值得精读。关注点:`requirements/test/xpu.in` 中使用 `>=` 而非固定版本,允许小版本升级,在 CI 中通过显式安装确保最低版本。

功能 重要性 9.00 洞察度 6.00

为 Kimi-VL 添加 ViT 全 CUDA 图支持

值得精读。重点阅读 `moonvit.py` 中 `prepare_encoder_metadata` 的设计(如何将 grid 相关计算外提)以及 `kimi_vl.py` 中协议方法的实现,可作为其他视觉模型启用 ViT CUDA 图的参考蓝本。

性能优化 重要性 6.21 洞察度 6.00

MiniMax-M3 在 MI300X 上启用 fp8_per_channel 量化,提升吞吐 28%

建议合入。该 PR 解决了 MiniMax-M3 在 ROCm 上的性能瓶颈,改动量小且经过充分验证。后续应关注长上下文和更多任务的精度表现。设计上通过参数传递链的轻微调整即可修复精度 bug 并启用新量化,值得参考。

缺陷修复 重要性 5.69 洞察度 6.00

修复 ROCm GFX942 上稀疏 MLA 精度退化

该 PR 是关键的 bugfix,值得精读以理解 GPU 内存对齐问题如何影响模型精度。建议关注后续性能优化,重新考虑是否以及如何在保障精度的前提下恢复 C++ 内核。

参与讨论