Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 18:24 同步状态:空闲 下次计划:2026-08-21 19:24

PR 列表

更多筛选
2026-06-17

#45870 [XPU][CI] fix server test file path

原始 PR · 作者 jikunshang · 合并时间 2026-06-17 09:06

缺陷修复 重要性 2.42 洞察度 2.00

修复 Intel CI 服务端测试文件路径

简单的路径修正 PR,无需深入审查。值得关注的是 CI 脚本中路径的准确性。

功能 重要性 7.25 洞察度 5.00

DS 布局 Mamba conv 状态尾复制支持

建议精读本 PR,特别是融合 kernel 中处理 strided 复制的设计,以及如何通过元数据避免额外内核启动。对于涉及 Triton kernel 开发或 Mamba 模型支持的团队成员,具有较高的参考价值。

#42656 Apply LRU policy only to proper cache entries

原始 PR · 作者 s3woz · 合并时间 2026-06-17 05:49

性能优化 重要性 7.15 洞察度 5.00

优化 KV cache 释放策略,仅对缓存条目应用 LRU

值得精读,特别是 `free_blocks` 的设计决策——将分类逻辑下沉到基础设施,对调用方透明。是经典的缓存替换策略改进案例。

功能 重要性 8.25 洞察度 6.00

支持 TRT-LLM MLA prefill 适配 GLM-5 维度

该 PR 是一项架构优雅的后端可扩展性改进,**值得精读**。重点关注: 1. `MLADimensions` dataclass 的引入如何取代布尔标志,使后端维度验证变得透明且可组合。 2. `validate_configuration` 从 `requires_r1_mla_dimensions and not is_r1_compatible` 变为白名单 membership 检查,这是“面向接口而非实现”的典型应用。 3. 文档生成工具用 AST 解析自动更新文档,保持代码与文档同步,值得其他模块效仿。 4. 未来新增 MLA 维度时,开发者只需在后端声明 `supported_mla_dimensions + MLADimensions(...)`,无需改动选择器或测试框架。

缺陷修复 重要性 7.09 洞察度 5.00

修复 Gemma4 required/named tool choice 误返回 JSON

建议阅读:展示了通过子类重写 adjust_request 优雅绕过基类 JSON 约束的通用模式,对其他模型解析器维护有参考价值。

#45858 [ROCm][CI] fix multimodel run cmds

原始 PR · 作者 divakar-amd · 合并时间 2026-06-17 04:31

缺陷修复 重要性 3.80 洞察度 2.00

修复 AMD CI 多模态测试误跑语言测试

建议精读该 PR 以了解 CI 配置修复方式。值得关注的设计决策:审核者指出这些命令在之前更新 AMD 定义时被忽略,说明 CI 配置维护需要更仔细的 review 流程。

功能 重要性 8.28 洞察度 6.00

新增 prefill step cadence 大幅提升 DP 场景 decode 延迟

值得精读,特别是 `schedule()` 中 defer 逻辑的实现和饱和保护机制。设计决策清晰,性能收益显著且经过充分基准测试。适合希望深入理解 v1 调度器及 DP 平衡策略的工程师。

参与讨论