Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-06-17
缺陷修复 重要性 6.09 洞察度 5.00

修复 ROCm FP8 per-tensor scale 维度不匹配导致编译失败

推荐关注该 PR 的开发者阅读 `apply_scaled_mm` 中的注释和改动,以便理解 `torch.compile` 对 scale tensor rank 的严格约束。设计上选择 `.view` 而非 `.reshape` 体现了对性能的谨慎考量,值得借鉴。

缺陷修复 重要性 6.74 洞察度 6.00

修复ROCm上MiniMax-M3 FP8 KV缓存dtype错误

本 PR 值得关注,尤其是跨平台 dtype 决策的提炼方式:引入 `current_platform.fp8_dtype()` 和 `is_fp8_fnuz()` 避免了平台硬编码,是类似问题的标准处理模式。同时,新增的测试覆盖了平台参数化,可以作为 dtype 选择场景的参考模板。建议开发者在涉及平台类型差异时采用类似策略。

缺陷修复 重要性 3.84 洞察度 3.00

修复 XPU 上 spec-decode logprobs 测试因注意力后端不匹配导致的数值差异

值得快速审查和合并。变更小且聚焦,解决了 Intel XPU 上的 CI 测试失败问题。对于维护多后端的跨平台测试,这个模式(提取平台特定配置)是一个很好的实践。

#45865 [CI] Run pre-commit on self-hosted vllm-runners

原始 PR · 作者 khluu · 合并时间 2026-06-17 10:49

基础设施 重要性 4.10 洞察度 4.00

pre-commit 迁移到自托管 vllm-runners

该 PR 是基础设施迁移的简单变更,值得关注的是如何使用 actionlint 配置自定义运行器标签以及通过 shellcheck-py 避免环境依赖问题。对于其他团队的自托管迁移有参考价值。

缺陷修复 重要性 6.63 洞察度 5.00

修复 Gemma4 禁用思考时工具调用解析错误

值得精读,尤其是关注 `adjust_request` 的设计模式——通过 `super().adjust_request()` 组合父类逻辑,并在子类中按条件覆盖特定属性。

缺陷修复 重要性 7.14 洞察度 7.00

修复 FlashInfer TRTLLM 后端 sleep 模式下 MoE 权重加载 OOM

建议精读该 PR,尤其关注作者如何系统性地定位问题(从 traceback 到 allocator 行为再到临时张量模式分析),以及设计决策(保留 max_split_size_mb=20 而选择优化自身)。对于维护者,建议补充 `_copy_permuted_expert_to_block_layout` 的单元测试,并关注 flashinfer 后续 API 变更。

#45870 [XPU][CI] fix server test file path

原始 PR · 作者 jikunshang · 合并时间 2026-06-17 09:06

缺陷修复 重要性 2.42 洞察度 2.00

修复 Intel CI 服务端测试文件路径

简单的路径修正 PR,无需深入审查。值得关注的是 CI 脚本中路径的准确性。

功能 重要性 7.25 洞察度 5.00

DS 布局 Mamba conv 状态尾复制支持

建议精读本 PR,特别是融合 kernel 中处理 strided 复制的设计,以及如何通过元数据避免额外内核启动。对于涉及 Triton kernel 开发或 Mamba 模型支持的团队成员,具有较高的参考价值。

参与讨论