Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15

PR 列表

更多筛选
2026-08-05
缺陷修复 重要性 5.54 洞察度 4.00

修复 Kimi-K3 MLA 禁用上下文并行时 DCP 哨兵值异常

该 PR 值得快速通读:单文件 5 行改动,适合作为理解「注意力后端 impl 的 dcp_world_size 契约」与「Kimi-K3 绕开共享包装器」之间差异的入口。若维护 Kimi-K3 或 MLA 相关代码,建议同步关注是否存在同样问题的其他平台路径,并考虑补一个单元测试锁定该归一化逻辑。

测试 重要性 5.94 洞察度 3.00

ROCm 新增 AITER per-token FP8 量化与 RMSNorm 确定性测试

作为纯测试补强 PR,价值主要在于防止 ROCm AITER 量化和归一化内核后续优化引入精度退化或非确定性。建议浏览测试断言方式(roundtrip 反量化对比、torch.equal 位级比较),不必精读;若后续要在 CI 中扩大覆盖,可考虑增加多 shape 参数化和多 GPU 确定性验证。对于维护者,可以关注宽松阈值是否足以捕获实际退化。

测试 重要性 6.42 洞察度 3.00

精简 SP/AsyncTP 端到端测试点并迁至 nightly

值得阅读,尤其是负责 CI/测试矩阵的工程师。优点:用 `_build_sp_args` + `_compare_sp_settings` 把环境过滤与参数构建抽离,配合 `compare_all_settings` 做批量对比,是很实用的测试重构范式;同时把耗时功能从 PR 门禁移到 nightly,体现测试分级思想。但要注意覆盖面取舍,后续若有 SP + eager/chunked prefill 相关改动应单独补测。

#51069 [CI] Prune `PyTorch Compilation Unit Tests`

原始 PR · 作者 mgoin · 合并时间 2026-08-05 09:53

测试 重要性 6.49 洞察度 4.00

精简 PyTorch 编译测试矩阵,CI 超时从 150 分钟降至 60 分钟

建议 CI/测试基础设施维护者精读。值得关注的设计决策:(1) 用 `DynamicShapesTestCase` frozen dataclass 替代 5 维参数化笛卡尔积,以 pairwise 子集保住核心组合;(2) module 级 `get_eager_outputs` fixture 缓存 eager 基线,避免每个编译 case 重复启动引擎;(3) 用 `compilation_counter.expect` 把计数器断言并入 `test_save_and_load`,在不损失验证强度的前提下删除两个独立测试。

缺陷修复 重要性 5.81 洞察度 4.00

修复关闭测试启动死锁:服务输出改文件重定向并移除 ROCm 特例

建议快速浏览而非精读:这是一个教科书级的 subprocess 管道缓冲区死锁修复,适合作为集成测试中规避子进程输出阻塞的参考模式——轮询就绪阶段用文件重定向、失败时再回读日志。主要供 CI/测试维护者学习;无需进入核心逻辑 review 清单。

基础设施 重要性 5.47 洞察度 7.00

ROCm 依赖升级 torch 2.12/triton 3.7,修复 AOT 加载死锁

值得 ROCm 平台及编译缓存相关开发者精读。本 PR 揭示了一个细致且典型的问题:依赖升级暴露默认路径的并发加载死锁,修复方案是平台相关的串行化,且注释清晰说明了根因。可作为依赖升级与平台 bugfix 组合的范例。

#51087 [CI] Add run-all comment commands

原始 PR · 作者 khluu · 合并时间 2026-08-05 08:34

基础设施 重要性 5.08 洞察度 4.00

新增 run all/nightly CI 命令变体,评论即可触发全量测试

建议 CI 负责人和维护者快速阅读本 PR,重点看 `RUN_CI_COMMAND_ENV` 映射表的组织方式以及“授权复用、文案不宣传”的组合策略;对想扩展 CI 评论命令的仓库来说这是一个小而完整的参考实现。普通开发者无需深入了解,不影响任何模型或推理路径。

参与讨论