Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15

PR 列表

更多筛选
2026-06-17
缺陷修复 重要性 3.84 洞察度 3.00

修复 XPU 上 spec-decode logprobs 测试因注意力后端不匹配导致的数值差异

值得快速审查和合并。变更小且聚焦,解决了 Intel XPU 上的 CI 测试失败问题。对于维护多后端的跨平台测试,这个模式(提取平台特定配置)是一个很好的实践。

#45865 [CI] Run pre-commit on self-hosted vllm-runners

原始 PR · 作者 khluu · 合并时间 2026-06-17 10:49

基础设施 重要性 4.10 洞察度 4.00

pre-commit 迁移到自托管 vllm-runners

该 PR 是基础设施迁移的简单变更,值得关注的是如何使用 actionlint 配置自定义运行器标签以及通过 shellcheck-py 避免环境依赖问题。对于其他团队的自托管迁移有参考价值。

缺陷修复 重要性 6.63 洞察度 5.00

修复 Gemma4 禁用思考时工具调用解析错误

值得精读,尤其是关注 `adjust_request` 的设计模式——通过 `super().adjust_request()` 组合父类逻辑,并在子类中按条件覆盖特定属性。

缺陷修复 重要性 7.14 洞察度 7.00

修复 FlashInfer TRTLLM 后端 sleep 模式下 MoE 权重加载 OOM

建议精读该 PR,尤其关注作者如何系统性地定位问题(从 traceback 到 allocator 行为再到临时张量模式分析),以及设计决策(保留 max_split_size_mb=20 而选择优化自身)。对于维护者,建议补充 `_copy_permuted_expert_to_block_layout` 的单元测试,并关注 flashinfer 后续 API 变更。

#45870 [XPU][CI] fix server test file path

原始 PR · 作者 jikunshang · 合并时间 2026-06-17 09:06

缺陷修复 重要性 2.42 洞察度 2.00

修复 Intel CI 服务端测试文件路径

简单的路径修正 PR,无需深入审查。值得关注的是 CI 脚本中路径的准确性。

功能 重要性 7.25 洞察度 5.00

DS 布局 Mamba conv 状态尾复制支持

建议精读本 PR,特别是融合 kernel 中处理 strided 复制的设计,以及如何通过元数据避免额外内核启动。对于涉及 Triton kernel 开发或 Mamba 模型支持的团队成员,具有较高的参考价值。

#42656 Apply LRU policy only to proper cache entries

原始 PR · 作者 s3woz · 合并时间 2026-06-17 05:49

性能优化 重要性 7.15 洞察度 5.00

优化 KV cache 释放策略,仅对缓存条目应用 LRU

值得精读,特别是 `free_blocks` 的设计决策——将分类逻辑下沉到基础设施,对调用方透明。是经典的缓存替换策略改进案例。

功能 重要性 8.25 洞察度 6.00

支持 TRT-LLM MLA prefill 适配 GLM-5 维度

该 PR 是一项架构优雅的后端可扩展性改进,**值得精读**。重点关注: 1. `MLADimensions` dataclass 的引入如何取代布尔标志,使后端维度验证变得透明且可组合。 2. `validate_configuration` 从 `requires_r1_mla_dimensions and not is_r1_compatible` 变为白名单 membership 检查,这是“面向接口而非实现”的典型应用。 3. 文档生成工具用 AST 解析自动更新文档,保持代码与文档同步,值得其他模块效仿。 4. 未来新增 MLA 维度时,开发者只需在后端声明 `supported_mla_dimensions + MLADimensions(...)`,无需改动选择器或测试框架。

参与讨论