Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-07-31

#49361 [ROCm]: bump AITER to 0.1.19

原始 PR · 作者 Rohan138 · 合并时间 2026-07-31 08:15

基础设施 重要性 2.77 洞察度 3.00

AITER 依赖升级至 v0.1.19

值得快速浏览以了解 ROCm 依赖升级流程;核心关注点是 AITER 0.1.19 的 gpt-oss 回归是否已在后续 PR 修复。若使用 ROCm 平台,阅读时应结合 `test_gpt_oss.py` 与 AITER 内核变更记录。

缺陷修复 重要性 5.23 洞察度 4.00

修复 Kimi K3 下 DeepGEMM BLOCK_D 断言崩溃

改动虽小但值得精读:它以最小变更修复了一个真实的高 TP 模型崩溃,揭示了 DeepGEMM EP 路径对 hidden_size 的隐含对齐约束;math.gcd 求块大小的做法也可作为类似 kernel 对齐问题的通用解法。若后续继续扩展 DeepGEMM 支持的非 1024 约数形状,建议顺手排查 deep_gemm_utils.py 中其他同类 min(...) 计算。

缺陷修复 重要性 4.01 洞察度 2.00

修复音频流测试 flaky 问题

建议合并。该 PR 以最小改动解决了 CI flaky 问题,但建议未来考虑更根本的修复(如放宽 token 级别匹配为语义匹配)或调查 prefix caching 对 ultravox 模型数值结果的影响程度。对于阅读者,可作为测试稳定性修复的参考案例。

功能 重要性 9.08 洞察度 7.00

新增多模块 MTP 推测器,支持逐层独立 draft

值得精读。核心看点包括:`MultiModuleMTPSpeculator` 如何通过缓存上一 decode 步输入与 hidden state 实现 re-prefill、`_build_draft_attn_metadata` 如何支持非均匀 query 布局,以及 issue 中作者对 KV 读侧/写侧/释放侧三层机制的阐述。对 spec decode 开发者而言,这是一个多模块状态修复的典型设计案例。建议合入后跟进 #50062、#50306,并着手补充单元测试与复用性重构。

基础设施 重要性 4.20 洞察度 3.00

更新 PR 自动标签规则:退役 v1 标签,新增 mrv2 标签

配置本身清晰合理,建议直接合并。但需确保在合并前完成标签重命名操作。

缺陷修复 重要性 8.23 洞察度 5.00

修复 Marlin 内核工作区和排序索引在权重重载时地址失效

建议量化相关开发者精读,了解 Marlin 内核的工作区模式和权重重载契约。FP8/NVFP4/MXFP4 等回退路径的同步修复模式值得学习。其他开发者可跳过。

重构 重要性 6.13 洞察度 4.00

优化 Rust 前端启动失败日志与就绪日志

建议精读,尤其是错误处理模式(从 `Result` 到 `ExitCode` 的迁移)和就绪日志的设计思路。对于类似需要统一错误输出格式的场景,本 PR 提供了良好参考。

参与讨论