Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-06-17

#42656 Apply LRU policy only to proper cache entries

原始 PR · 作者 s3woz · 合并时间 2026-06-17 05:49

性能优化 重要性 7.15 洞察度 5.00

优化 KV cache 释放策略,仅对缓存条目应用 LRU

值得精读,特别是 `free_blocks` 的设计决策——将分类逻辑下沉到基础设施,对调用方透明。是经典的缓存替换策略改进案例。

功能 重要性 8.25 洞察度 6.00

支持 TRT-LLM MLA prefill 适配 GLM-5 维度

该 PR 是一项架构优雅的后端可扩展性改进,**值得精读**。重点关注: 1. `MLADimensions` dataclass 的引入如何取代布尔标志,使后端维度验证变得透明且可组合。 2. `validate_configuration` 从 `requires_r1_mla_dimensions and not is_r1_compatible` 变为白名单 membership 检查,这是“面向接口而非实现”的典型应用。 3. 文档生成工具用 AST 解析自动更新文档,保持代码与文档同步,值得其他模块效仿。 4. 未来新增 MLA 维度时,开发者只需在后端声明 `supported_mla_dimensions + MLADimensions(...)`,无需改动选择器或测试框架。

缺陷修复 重要性 7.09 洞察度 5.00

修复 Gemma4 required/named tool choice 误返回 JSON

建议阅读:展示了通过子类重写 adjust_request 优雅绕过基类 JSON 约束的通用模式,对其他模型解析器维护有参考价值。

#45858 [ROCm][CI] fix multimodel run cmds

原始 PR · 作者 divakar-amd · 合并时间 2026-06-17 04:31

缺陷修复 重要性 3.80 洞察度 2.00

修复 AMD CI 多模态测试误跑语言测试

建议精读该 PR 以了解 CI 配置修复方式。值得关注的设计决策:审核者指出这些命令在之前更新 AMD 定义时被忽略,说明 CI 配置维护需要更仔细的 review 流程。

功能 重要性 8.28 洞察度 6.00

新增 prefill step cadence 大幅提升 DP 场景 decode 延迟

值得精读,特别是 `schedule()` 中 defer 逻辑的实现和饱和保护机制。设计决策清晰,性能收益显著且经过充分基准测试。适合希望深入理解 v1 调度器及 DP 平衡策略的工程师。

性能优化 重要性 6.95 洞察度 5.00

MiniMax-M3 MXFP8 内核 tile 配置调优

值得精读,尤其关注 tile 选择函数的设计模式:在 compute kernel 中引入 regime-based tile 选择是一个通用的优化技巧。该 PR 代码简洁,思路清晰,适合作为 kernel 调优的参考。

性能优化 重要性 7.97 洞察度 6.00

融合多 KV-group 的 block table 分阶段写入为一个 Triton 内核

值得精读设计模式:如何将多个 `StagedWriteTensor` 的 staged writes 融合为一个内核,保持单组路径不变。但性能收益需在自有环境复现后再决定是否启用。建议增加更全面的压力测试和跨后端验证。

参与讨论