Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 18:31 同步状态:空闲 下次计划:2026-08-20 19:31

PR 列表

更多筛选
2026-06-23
性能优化 重要性 6.13 洞察度 5.00

融合 MLA Q 拼接与 FP8 量化,减少 ROCm decode 延迟

该 PR 值得快速合入,性能效果明确且验证充分。但建议关注 Gemini 的架构建议,在后续清理 PR 中考虑使用 supports_quant_query_input 统一模式,以减少手动调用和潜在不一致。

#46441 fix gpt_oss pp>1 with ep

原始 PR · 作者 mayuyuace · 合并时间 2026-06-23 16:59

缺陷修复 重要性 5.59 洞察度 4.00

修复 GPT-OSS 在 PP > 1 时 EP 权重加载失败

该 PR 是一行修复,逻辑清晰,风险低,建议合入。值得关注的是评审者的发现:GPT-OSS 是唯一错误使用 `get_ep_group().rank` 的模型,其他模型实现均正确。建议后续在代码审查中统一推广 `rank_in_group` 的使用,或在框架层面封装正确的方法以避免类似 bug。

缺陷修复 重要性 7.54 洞察度 3.00

Rust 前端拒绝空 allowed_token_ids,对齐 Python 校验

此 PR 是典型的跨语言行为对齐修复,代码简洁、构造清晰、测试完备,适合浏览以了解 Rust 前端的参数验证流程。特别值得注意的是错误类型的重构思路——通过枚举替代独立结构体,保持了错误层次的整洁。

功能 重要性 8.45 洞察度 4.00

支持 token-ID 类型 prompt 的 echo 回显

此 PR 值得精读,展示了在 Rust 前端中为 completions 端点添加新功能的清晰模式:调整验证层、新增转换函数、注入 tokenizer 依赖,并辅以集成测试。这种模式可复用于其他 feature parity 任务。

#46452 Doc: fix missing GLM-5.x in supported models

原始 PR · 作者 ZichenYuan · 合并时间 2026-06-23 15:42

文档 重要性 1.42 洞察度 1.00

在支持模型表中添加GLM-5.x

可快速合入,无审查风险。对于关注 GLM 系列模型的用户,该文档更新提供了有用的参考信息。

缺陷修复 重要性 8.57 洞察度 5.00

修正 Rust 前端的 reasoning-parser 语义

值得关注。PR 清晰地区分了两条启动路径的默认值语义,是 Rust 前端与 Python 后端深度集成的重要补丁。设计决策(使用 `default_py_bootstrap_parser_selection` 函数覆盖 serde 默认)可复用,`effective_engine_reasoning_parser` 的解析逻辑值得参考。

缺陷修复 重要性 5.52 洞察度 6.00

修复 allowed_token_ids 静默丢失的竞态 bug

该 PR 改动简洁、定位精准,值得所有 V2 Model Runner 使用者关注。推荐的阅读重点: - `_bias_kernel` 中竞态的分析方法(不同线程对相同地址的读写顺序问题)是 Triton 编程中一类典型 bug,值得学习。 - 屏障插入位置的权衡,以及为何不使用更重的同步原语。 - 扩展的测试用例设计,覆盖了从低到高的跨 vocab token id。

参与讨论