修复 ROCm FP8 per-tensor scale 维度不匹配导致编译失败
推荐关注该 PR 的开发者阅读 `apply_scaled_mm` 中的注释和改动,以便理解 `torch.compile` 对 scale tensor rank 的严格约束。设计上选择 `.view` 而非 `.reshape` 体现了对性能的谨慎考量,值得借鉴。
A high-throughput and memory-efficient inference and serving engine for LLMs
修复 ROCm FP8 per-tensor scale 维度不匹配导致编译失败
推荐关注该 PR 的开发者阅读 `apply_scaled_mm` 中的注释和改动,以便理解 `torch.compile` 对 scale tensor rank 的严格约束。设计上选择 `.view` 而非 `.reshape` 体现了对性能的谨慎考量,值得借鉴。
修复ROCm上MiniMax-M3 FP8 KV缓存dtype错误
本 PR 值得关注,尤其是跨平台 dtype 决策的提炼方式:引入 `current_platform.fp8_dtype()` 和 `is_fp8_fnuz()` 避免了平台硬编码,是类似问题的标准处理模式。同时,新增的测试覆盖了平台参数化,可以作为 dtype 选择场景的参考模板。建议开发者在涉及平台类型差异时采用类似策略。
原始 PR · 作者 chaojun-zhang · 合并时间 2026-06-17 11:07
修复 XPU 上 spec-decode logprobs 测试因注意力后端不匹配导致的数值差异
值得快速审查和合并。变更小且聚焦,解决了 Intel XPU 上的 CI 测试失败问题。对于维护多后端的跨平台测试,这个模式(提取平台特定配置)是一个很好的实践。
pre-commit 迁移到自托管 vllm-runners
该 PR 是基础设施迁移的简单变更,值得关注的是如何使用 actionlint 配置自定义运行器标签以及通过 shellcheck-py 避免环境依赖问题。对于其他团队的自托管迁移有参考价值。
修复 Gemma4 禁用思考时工具调用解析错误
值得精读,尤其是关注 `adjust_request` 的设计模式——通过 `super().adjust_request()` 组合父类逻辑,并在子类中按条件覆盖特定属性。
修复 FlashInfer TRTLLM 后端 sleep 模式下 MoE 权重加载 OOM
建议精读该 PR,尤其关注作者如何系统性地定位问题(从 traceback 到 allocator 行为再到临时张量模式分析),以及设计决策(保留 max_split_size_mb=20 而选择优化自身)。对于维护者,建议补充 `_copy_permuted_expert_to_block_layout` 的单元测试,并关注 flashinfer 后续 API 变更。
原始 PR · 作者 jikunshang · 合并时间 2026-06-17 09:06
修复 Intel CI 服务端测试文件路径
简单的路径修正 PR,无需深入审查。值得关注的是 CI 脚本中路径的准确性。
DS 布局 Mamba conv 状态尾复制支持
建议精读本 PR,特别是融合 kernel 中处理 strided 复制的设计,以及如何通过元数据避免额外内核启动。对于涉及 Triton kernel 开发或 Mamba 模型支持的团队成员,具有较高的参考价值。
参与讨论