Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-22 00:42 同步状态:空闲 下次计划:2026-08-22 01:42

PR 列表

更多筛选
2026-06-30
缺陷修复 重要性 5.49 洞察度 5.00

修复 FA4 动态因果遮罩失效问题

建议精读。该 PR 用极小的改动(+4/-1)修复了一个不易察觉的正确性问题,展示了在复杂注意力调度中因果遮罩与滑动窗口交互的关键细节。值得关注的设计决策:如何通过 `has_window` 判断决定 `causal` 参数,避免强制设为 False。

缺陷修复 重要性 5.36 洞察度 5.00

修复测试依赖固定与 xgrammar 兼容性

建议技术管理者关注此 PR 采用的依赖管理策略:将公共依赖固定在 `common.txt` 中,各平台测试依赖通过 `-r` 引用并用 `pip-compile` 生成锁定文件。这种方法值得在项目其他部分推广。测试断言的语义化改进也值得参考。

功能 重要性 9.18 洞察度 7.00

V2 Model Runner 支持 Mamba hybrid 模型 align 前缀缓存

本 PR 实现清晰,讨论深入,适合希望理解 Mamba 前缀缓存在 V2 中实现细节的工程师精读。特别是 copy-free vs pre-copy 的设计权衡以及 Triton kernel 的共享技术值得学习。

#43729 Support DCP with FlashInfer MLA

原始 PR · 作者 WoosukKwon · 合并时间 2026-06-30 04:24

功能 重要性 5.12 洞察度 5.00

FlashInfer MLA 支持返回 LSE,开启 DCP 功能

值得阅读,特别是关注 MLA attention backend 如何通过 attribute 和 condition 扩展功能。设计上使用 `can_return_lse_for_decode` 类属性和 `need_to_return_lse_for_decode` 实例属性分离能力声明与运行时决策,值得参考。建议配合 PR #47079 一起合入以修复 LSE log-base 问题。

缺陷修复 重要性 5.51 洞察度 4.00

XPU RMSNorm 回退 weightless 优化

建议精读了解 XPU 平台上的 kernel dispatch 优化策略。回退逻辑清晰,评审充分,可安全合入。

#46986 [Bugfix] Fix DeepseekV2Model hidden_size

原始 PR · 作者 jeejeelee · 合并时间 2026-06-30 00:44

缺陷修复 重要性 5.25 洞察度 2.00

修复 DeepseekV2Model hidden_size 引用错误

值得合并,属于规范化修复,提升代码一致性和可维护性。建议后续考虑在相似模型中推广此模式。

参与讨论