Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 18:24 同步状态:空闲 下次计划:2026-08-21 19:24

PR 列表

更多筛选
2026-07-31
缺陷修复 重要性 4.22 洞察度 4.00

重试 HF processor 加载,缓解共享缓存并发刷新导致的 CI 抖动

该 PR 值得快速浏览而非精读。关注点有二:一是 `with_retry` 在 `vllm.transformers_utils.repo_utils` 中的重试策略(次数、退避)是否与 CI 超时预算匹配;二是这种"加载重试"模式是否也应推广到 `AutoTokenizer` 和模型权重加载的测试路径,以系统性消除共享缓存并发刷新的 flaky 问题。

缺陷修复 重要性 7.06 洞察度 6.00

修复 Rust 前端 stop string 选用逻辑

建议精读:这是一个小而精确的 bugfix,展示了如何通过修改一行核心逻辑(`find_map` → `filter_map` + `min_by_key`)对齐跨前端行为。测试设计值得学习,尤其是边缘情况的覆盖。

#49361 [ROCm]: bump AITER to 0.1.19

原始 PR · 作者 Rohan138 · 合并时间 2026-07-31 08:15

基础设施 重要性 2.77 洞察度 3.00

AITER 依赖升级至 v0.1.19

值得快速浏览以了解 ROCm 依赖升级流程;核心关注点是 AITER 0.1.19 的 gpt-oss 回归是否已在后续 PR 修复。若使用 ROCm 平台,阅读时应结合 `test_gpt_oss.py` 与 AITER 内核变更记录。

缺陷修复 重要性 5.23 洞察度 4.00

修复 Kimi K3 下 DeepGEMM BLOCK_D 断言崩溃

改动虽小但值得精读:它以最小变更修复了一个真实的高 TP 模型崩溃,揭示了 DeepGEMM EP 路径对 hidden_size 的隐含对齐约束;math.gcd 求块大小的做法也可作为类似 kernel 对齐问题的通用解法。若后续继续扩展 DeepGEMM 支持的非 1024 约数形状,建议顺手排查 deep_gemm_utils.py 中其他同类 min(...) 计算。

缺陷修复 重要性 4.01 洞察度 2.00

修复音频流测试 flaky 问题

建议合并。该 PR 以最小改动解决了 CI flaky 问题,但建议未来考虑更根本的修复(如放宽 token 级别匹配为语义匹配)或调查 prefix caching 对 ultravox 模型数值结果的影响程度。对于阅读者,可作为测试稳定性修复的参考案例。

功能 重要性 9.08 洞察度 7.00

新增多模块 MTP 推测器,支持逐层独立 draft

值得精读。核心看点包括:`MultiModuleMTPSpeculator` 如何通过缓存上一 decode 步输入与 hidden state 实现 re-prefill、`_build_draft_attn_metadata` 如何支持非均匀 query 布局,以及 issue 中作者对 KV 读侧/写侧/释放侧三层机制的阐述。对 spec decode 开发者而言,这是一个多模块状态修复的典型设计案例。建议合入后跟进 #50062、#50306,并着手补充单元测试与复用性重构。

基础设施 重要性 4.20 洞察度 3.00

更新 PR 自动标签规则:退役 v1 标签,新增 mrv2 标签

配置本身清晰合理,建议直接合并。但需确保在合并前完成标签重命名操作。

缺陷修复 重要性 8.23 洞察度 5.00

修复 Marlin 内核工作区和排序索引在权重重载时地址失效

建议量化相关开发者精读,了解 Marlin 内核的工作区模式和权重重载契约。FP8/NVFP4/MXFP4 等回退路径的同步修复模式值得学习。其他开发者可跳过。

参与讨论