裁剪 ROCm 融合测试参数化,耗时从 2.5 小时降至 6 分钟
值得一读,尤其是大型参数化测试的加速思路:裁剪冗余参数、用模块级清理替代逐用例清理、收集期跳过与版本门槛。不过要关注覆盖度变化,未来若要新增参数组合应充分评估必要性。
标签列表
聚合结果
裁剪 ROCm 融合测试参数化,耗时从 2.5 小时降至 6 分钟
值得一读,尤其是大型参数化测试的加速思路:裁剪冗余参数、用模块级清理替代逐用例清理、收集期跳过与版本门槛。不过要关注覆盖度变化,未来若要新增参数组合应充分评估必要性。
原始 PR · 作者 wangxiyuan · 合并时间 2026-08-19 18:31
为 torch.compile 补全平台后端参数,默认仍为 inductor
值得快速浏览的 PR,尤其是平台开发者。改动虽小,但清晰展示了 vLLM 如何通过 `current_platform.simple_compile_backend` 统一管理编译后端。建议关注 `kimi_k25_vit.py` 中 `disable` 与 `backend` 的组合方式,以及后续是否有平台真正覆盖该属性。
原始 PR · 作者 bastefaniak · 合并时间 2026-08-14 06:08
重写 MRoPE 交错重排实现,修复 torch.compile 2.13 输出错误
值得精读。该 PR 展示了一个针对编译后端回归的等价重写手法(用索引掩码 + `torch.where` 替代切片赋值),以及用 eager-vs-torch.compile 对拍测试锁定数值一致性的方法。建议关注 PyTorch 上游 issue 193183 的修复,并在代码中保留 workaround 注释以便将来回退。
修复 Triton 量化内核在 torch.compile 下编译失败
值得花 10 分钟精读 PR body + 4 行 diff。这是一个非常典型的 Triton 与 torch.compile 类型系统交互问题:同一个 Python float 参数在 eager 与 Inductor 下被赋予不同 dtype,从而诱发不支持的 LLVM 转换。对经常写 Triton kernel 或维护量化路径的工程师,建议把"将常量标量声明为 `tl.constexpr`"当作 torch.compile 兼容性的默认习惯。后续可跟进补一个 `compile_mm_encoder` 路径的回归测试。
修复 base.py 中过时的 docstring 声明
不值得精读。这是一个简单的文档一致性修复,可作为维护 docstring 与签名同步的小案例。关注点在于它避免了文档构建工具对错误参数声明的警告。
精简 PyTorch Fullgraph 测试矩阵与 CI 步骤
该 PR 属于常规测试维护,值得快速浏览 diff 了解测试裁剪决策;不建议精读。关注点在于合并后的超时风险与覆盖缩减是否可接受。
精简 SP/AsyncTP 端到端测试点并迁至 nightly
值得阅读,尤其是负责 CI/测试矩阵的工程师。优点:用 `_build_sp_args` + `_compare_sp_settings` 把环境过滤与参数构建抽离,配合 `compare_all_settings` 做批量对比,是很实用的测试重构范式;同时把耗时功能从 PR 门禁移到 nightly,体现测试分级思想。但要注意覆盖面取舍,后续若有 SP + eager/chunked prefill 相关改动应单独补测。
精简 PyTorch 编译测试矩阵,CI 超时从 150 分钟降至 60 分钟
建议 CI/测试基础设施维护者精读。值得关注的设计决策:(1) 用 `DynamicShapesTestCase` frozen dataclass 替代 5 维参数化笛卡尔积,以 pairwise 子集保住核心组合;(2) module 级 `get_eager_outputs` fixture 缓存 eager 基线,避免每个编译 case 重复启动引擎;(3) 用 `compilation_counter.expect` 把计数器断言并入 `test_save_and_load`,在不损失验证强度的前提下删除两个独立测试。