Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 19:35 同步状态:空闲 下次计划:2026-08-21 20:35

PR 列表

更多筛选
2026-07-05
缺陷修复 重要性 7.78 洞察度 6.00

修复 FA4 后端 Gemma4 长上下文乱码

建议合入该 PR,它修复了 Gemma4 在 FA4 后端上的严重输出错误。推荐注意力后端开发者详细阅读 `_make_mm_prefix_mask_mod` 的修改,学习如何正确地将滑动窗口与自定义 mask_mod 结合,以及绝对位置计算在分块预填充中的关键作用。对于使用 mm_prefix 特性的模型维护者,可参考其滑动窗口 clamp 的设计。

缺陷修复 重要性 5.29 洞察度 3.00

修复批量聊天采样参数覆盖问题

这是一个小而关键的 bugfix,建议合并。代码变更量少(4 行增加值、4 行删除值),逻辑清晰,且已通过 E2E 测试验证。值得关注的设计决策是遵循了 '与 ChatCompletionRequest 保持一致' 的原则,避免了为批量接口单独维护一套默认值。

#47198 [Perf] Remove redundant op for GLM 5.2

原始 PR · 作者 yewentao256 · 合并时间 2026-07-05 01:25

性能优化 重要性 6.32 洞察度 4.00

消除 GLM 5.2 稀疏注意力中冗余算子

值得合并。改动小、无风险,且是 Issue #46654 性能优化工作中清除冗余算子的典型步骤。对维护者而言,这类零碎优化在长期可积累显著的端到端加速。

2026-07-04
基础设施 重要性 5.79 洞察度 4.00

升级 huggingface-hub 至 v1.22.0,优化模型下载缓存

建议快速合入此 PR,因为依赖升级带来明确的性能收益且经过了充分测试。开发人员应注意离线场景可能出现的 IncompleteSnapshotError,并确保缓存策略的完整性。测试维护者需确认所有 gpt2 引用已更新完毕。

缺陷修复 重要性 6.05 洞察度 3.00

为 pooling 请求添加 cache_salt 非空验证

推荐阅读,可作为 Pydantic 模型校验的参考示例。变更小、风险低,可直接合并。

参与讨论