Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 19:35 同步状态:空闲 下次计划:2026-08-21 20:35

PR 列表

更多筛选
2026-06-23
重构 重要性 7.21 洞察度 5.00

重构 Quark FP8 MoE 使用 oracle 后端并添加 Qwen3 评测

本 PR 是 vLLM 量化后端统一化的重要一步,反映了从手写分支到可扩展 oracle 模式的演进趋势。建议量化相关模块的维护者仔细阅读 `quark_moe.py` 的变更,理解后端选择流程。新增的评测配置也可作为 FP8 量化质量回归的参考。整体变更清晰,风险可控。

缺陷修复 重要性 7.13 洞察度 6.00

提前预留 TurboQuant workspace 防止 CUDA graph 锁定断言

此 PR 修复了一个影响 TurboQuant 用户的关键 bug,代码简洁且测试充分。建议阅读了解如何通过提前预留 workspace 解决 graph capture 后的动态分配问题。设计上保持了关注点分离(逻辑在 attention backend 内)。推荐合入。

缺陷修复 重要性 7.27 洞察度 5.00

修复 static actorder 下 WNA16 MoE w2 scales sharding

值得精读的设计决策:将 sharding 规则提取为纯静态方法,方便单元测试和后续扩展;早失败原则(对不可整除 size 抛出异常)优于运行时 CUDA 崩溃。建议未来关注枚举替换字符串的后续 PR。

参与讨论