Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 23:04 同步状态:空闲 下次计划:2026-08-22 00:04

PR 列表

更多筛选
2026-06-30
缺陷修复 重要性 5.36 洞察度 5.00

修复测试依赖固定与 xgrammar 兼容性

建议技术管理者关注此 PR 采用的依赖管理策略:将公共依赖固定在 `common.txt` 中,各平台测试依赖通过 `-r` 引用并用 `pip-compile` 生成锁定文件。这种方法值得在项目其他部分推广。测试断言的语义化改进也值得参考。

功能 重要性 9.18 洞察度 7.00

V2 Model Runner 支持 Mamba hybrid 模型 align 前缀缓存

本 PR 实现清晰,讨论深入,适合希望理解 Mamba 前缀缓存在 V2 中实现细节的工程师精读。特别是 copy-free vs pre-copy 的设计权衡以及 Triton kernel 的共享技术值得学习。

#43729 Support DCP with FlashInfer MLA

原始 PR · 作者 WoosukKwon · 合并时间 2026-06-30 04:24

功能 重要性 5.12 洞察度 5.00

FlashInfer MLA 支持返回 LSE,开启 DCP 功能

值得阅读,特别是关注 MLA attention backend 如何通过 attribute 和 condition 扩展功能。设计上使用 `can_return_lse_for_decode` 类属性和 `need_to_return_lse_for_decode` 实例属性分离能力声明与运行时决策,值得参考。建议配合 PR #47079 一起合入以修复 LSE log-base 问题。

缺陷修复 重要性 5.51 洞察度 4.00

XPU RMSNorm 回退 weightless 优化

建议精读了解 XPU 平台上的 kernel dispatch 优化策略。回退逻辑清晰,评审充分,可安全合入。

#46986 [Bugfix] Fix DeepseekV2Model hidden_size

原始 PR · 作者 jeejeelee · 合并时间 2026-06-30 00:44

缺陷修复 重要性 5.25 洞察度 2.00

修复 DeepseekV2Model hidden_size 引用错误

值得合并,属于规范化修复,提升代码一致性和可维护性。建议后续考虑在相似模型中推广此模式。

性能优化 重要性 8.70 洞察度 5.00

扩展 Triton kernel warmup 覆盖,支持 DSv4 稀疏 MLA 和 block table

值得精读。该 PR 展示了如何系统地为 Triton JIT kernel 添加启动预热,包含 backend 检测、参数空间枚举、条件过滤等模式。特别关注 `sparse_mla_triton_warmup.py` 中的 backend 识别和参数组合设计,以及审核中关于 MRv1/MRv2 差异的处理。可作为后续模型特定预热功能开发的参考。

#46683 Bump flashinfer version to 0.6.13

原始 PR · 作者 wzhao18 · 合并时间 2026-06-30 00:30

基础设施 重要性 6.43 洞察度 5.00

FlashInfer升级0.6.13并启用持久缓存

建议仔细审阅`flashinfer_autotune`函数中DeepEP的判断逻辑,确认覆盖了所有相关的all2all后端。同时关注FlashInfer上游后续是否彻底解决持久缓存问题,届时可移除特判。GSM8K超时调整作为配套,无特别风险。

参与讨论