Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 18:24 同步状态:空闲 下次计划:2026-08-21 19:24

PR 列表

更多筛选
2026-05-26
功能 重要性 8.04 洞察度 5.00

暴露 MooncakeStore 加载失败的 block ID

值得精读:该 PR 展示了如何在使用 C++ 扩展的异步线程中正确捕获和传播底层错误,以及如何设计线程安全的状态收集接口。建议部署了 MooncakeStore 连接器的团队尽快合入,以获得更好的错误诊断能力。

缺陷修复 重要性 6.88 洞察度 5.00

修复 Eagle 双重剪枝致 MooncakeStore 加载 KV 损坏

强烈建议阅读此 PR,尤其关注 `coordinator.py` 中的 `apply_eagle` 参数设计:如何通过布尔参数区分 lookup 与 mask 的 Eagle 需求。PR body 的 Walkthrough 部分也非常清晰地描述了 bug 复现步骤和修复逻辑。新增的测试是很好的契约测试范例。

功能 重要性 9.18 洞察度 6.00

MoE LoRA 单 Triton 核融合与双流并行

该 PR 是一次精心设计的内核融合优化,代码质量较高,测试充分。对于理解 vLLM 中 MoE+LoRA 的 Kernel 层优化思想有较高参考价值。特别值得关注的设计决策包括: - 融合核如何通过 `add_inputs` 参数服务于双流路径(零缓冲区分开基与 LoRA 输出); - `maybe_execute_in_parallel` 工具函数的使用; - 双流事件管理的设计(4 事件避免重用)。 建议关注 rank 128 限制的风险,未来可能需解决。

2026-05-25

#43554 [Kernel] Remove NormGateLinear

原始 PR · 作者 jeejeelee · 合并时间 2026-05-25 17:49

重构 重要性 8.75 洞察度 4.00

删除 NormGateLinear 及相关融合内核代码

此 PR 主要是清理操作,值得快速审阅。关注 NVIDIA 和 AMD 模型变更的一致性,并留意 AMD 平台后续是否可融合 norm 到 MHC 以获得性能收益。

缺陷修复 重要性 6.86 洞察度 5.00

修复MooncakeStore preemption后 request_finished 断言崩溃

该 PR 值得精读,展示了如何在分布式 KV 传输组件中优雅处理 preemption 边界情况,设计决策(重置 tracker 而非移除)和 review 讨论都具有参考价值。

参与讨论