重构在线量化配置,引入 QuantSpec 支持按层类型指定量化方案
该 PR 是 vLLM 量化配置体系的核心架构变更,值得团队成员细致 review,特别是涉及 QuantSpec 设计模式、activate 覆盖与现有量化协议的交互。建议在合并前确保现有集成测试(特别是 Blackwell MoE 和 gpt-oss)通过。
A high-throughput and memory-efficient inference and serving engine for LLMs
重构在线量化配置,引入 QuantSpec 支持按层类型指定量化方案
该 PR 是 vLLM 量化配置体系的核心架构变更,值得团队成员细致 review,特别是涉及 QuantSpec 设计模式、activate 覆盖与现有量化协议的交互。建议在合并前确保现有集成测试(特别是 Blackwell MoE 和 gpt-oss)通过。
修复 NIXL EP 安装时 CUDA 版本冲突
值得精读,但更应关注上游 nixl 的长期修复。当前 PR 是镜像构建的临时修复,可作为 CI/CD 调试参考。
为 Completions API 添加 thinking_token_budget 参数
该 PR 变更简单清晰,值得快速合入。建议后续为 `thinking_token_budget` 补充范围校验和测试。有权限的维护者已批准合入,无需过多关注。
原始 PR · 作者 yewentao256 · 合并时间 2026-05-14 03:37
修复 Quark MoE 类型注解和参数名,通过 mypy 检查
建议合并前确认 `apply` 中参数顺序是否正确,可参考 `modular_kernel.py` 中的定义。若确认错误,应在此 PR 或后续修复中更正。
共享 MTP 相同权重,减少显存占用
建议精读此 PR,尤其是 `_should_share` 函数的实现和权重共享的完整流程。该设计体现了“资源不足时 fallback”和“避免重复计算”的优良风格,值得学习。同时也应关注 PP 场景下的潜在风险,建议作者在后续 PR 中补充更多测试并回应 review 中的疑虑。
原始 PR · 作者 fxmarty-amd · 合并时间 2026-05-14 02:17
支持加载 Quark NVFP4 检查点
该 PR 设计清晰,复用现有 NVFP4 内核基础设施,整体风险可控。推荐阅读 `QuarkNVFP4` 的实现,了解多级量化方案扩展的方法论。对于使用 Quark 的用户,该 PR 是运行 NVFP4 模型的关键入口。
移除 speculative config 中硬编码的模型类型检查
该 PR 值得快速合并,逻辑简洁且正确。建议关注后续是否有模型因接口未实现而导致运行时错误,可考虑补充单元测试验证配置链路的完整性。
修复 gpt-oss 模型 bare 工具调用解析丢失 bug
值得精读。PR 展示了如何在不改动模型输出的前提下,通过工具名称列表和优先级规则健壮解析非标准格式。`is_function_recipient` 的设计可复用,review 中对边界情况的讨论有参考价值。
参与讨论