Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 19:35 同步状态:空闲 下次计划:2026-08-21 20:35

PR 列表

更多筛选
2026-06-23
缺陷修复 重要性 5.42 洞察度 4.00

修复 CPU 推测解码因 USE_FP64_GUMBEL 崩溃

此 PR 是一次必要且安全的回归修复,改动极小(+3/-1 行),建议合入。值得关注的是:当为 GPU 内核添加新参数时,需同步更新所有 CPU / 回退封装函数以避免类似 API 不一致错误。

重构 重要性 9.18 洞察度 6.00

拆分 ServingRender 为 OnlineRenderer/OnlineDerenderer,重构前端渲染架构

值得精读。展示了如何通过职责拆分降低模块耦合,并涉及多文件联动的系统工程。设计上采用 BaseServing 统一入口模式,为后续前端模块化提供了参考。但需注意在合并前确保导入问题已修复,并补充 render-only 场景的集成测试。

功能 重要性 8.97 洞察度 6.00

支持 MoRIIO 异构 TP 的 ACK fan-in 与 rank 映射

值得精读,特别是 `get_moriio_remote_tp_rank` 的映射策略和 ACK fan-in 的设计。该设计为不同推理阶段的 TP 异构提供了可扩展的框架。测试覆盖全面,建议参考测试用例理解边界条件。

性能优化 重要性 6.13 洞察度 5.00

融合 MLA Q 拼接与 FP8 量化,减少 ROCm decode 延迟

该 PR 值得快速合入,性能效果明确且验证充分。但建议关注 Gemini 的架构建议,在后续清理 PR 中考虑使用 supports_quant_query_input 统一模式,以减少手动调用和潜在不一致。

#46441 fix gpt_oss pp>1 with ep

原始 PR · 作者 mayuyuace · 合并时间 2026-06-23 16:59

缺陷修复 重要性 5.59 洞察度 4.00

修复 GPT-OSS 在 PP > 1 时 EP 权重加载失败

该 PR 是一行修复,逻辑清晰,风险低,建议合入。值得关注的是评审者的发现:GPT-OSS 是唯一错误使用 `get_ep_group().rank` 的模型,其他模型实现均正确。建议后续在代码审查中统一推广 `rank_in_group` 的使用,或在框架层面封装正确的方法以避免类似 bug。

缺陷修复 重要性 7.54 洞察度 3.00

Rust 前端拒绝空 allowed_token_ids,对齐 Python 校验

此 PR 是典型的跨语言行为对齐修复,代码简洁、构造清晰、测试完备,适合浏览以了解 Rust 前端的参数验证流程。特别值得注意的是错误类型的重构思路——通过枚举替代独立结构体,保持了错误层次的整洁。

功能 重要性 8.45 洞察度 4.00

支持 token-ID 类型 prompt 的 echo 回显

此 PR 值得精读,展示了在 Rust 前端中为 completions 端点添加新功能的清晰模式:调整验证层、新增转换函数、注入 tokenizer 依赖,并辅以集成测试。这种模式可复用于其他 feature parity 任务。

参与讨论