Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15

PR 列表

更多筛选
2026-07-11
性能优化 重要性 4.18 洞察度 4.00

使用 meta tensor 计算 KV cache stride,避免无意义显存分配

该 PR 是典型的微小性能优化,代码简洁、风险低,值得快速合并。开发者可以学习使用 meta tensor 来避免不必要的张量分配。

缺陷修复 重要性 6.71 洞察度 6.00

降低 NVFP4 MoE 权重重排的峰值内存占用

建议精读。该 PR 展示了一个经典的用空间换时间到时间换空间的优化思路,review 中对正确性的深入讨论(原地操作的副作用)值得所有开发者注意。chunk swap 的实现也值得作为类似操作的参考。

缺陷修复 重要性 7.56 洞察度 6.00

修复自然思考结束后预算重入失效问题

建议阅读 `thinking_budget_state.py` 中 `_update_think_state` 的重写逻辑,理解 `scan_offset` 和早期检测的配合方式。测试代码 `TestThinkingBudgetNaturalEndReentry` 覆盖全面,可作为状态机边界测试的参考。

缺陷修复 重要性 3.53 洞察度 2.00

修复 Qwen3.5-4B 模型注册缺失导致测试失败

小型测试修复 PR,无需精读。但值得关注的是 `_HfExamplesInfo` 的 `extras` 用法,它提供了一种在不改变默认示例模型的情况下注册额外模型的方式,可用于类似场景。

#47785 handle topk_ids padding in align sum kernel

原始 PR · 作者 gnovack · 合并时间 2026-07-11 04:33

缺陷修复 重要性 5.03 洞察度 3.00

修复 MoE align 内核中 topk_ids 的 -1 填充处理

此 PR 是对关键路径的鲁棒性修复,建议尽快合并。设计决策(将合法性检查封装为独立函数)值得借鉴,便于后续维护和扩展。

参与讨论