Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-07-05
缺陷修复 重要性 5.29 洞察度 3.00

修复批量聊天采样参数覆盖问题

这是一个小而关键的 bugfix,建议合并。代码变更量少(4 行增加值、4 行删除值),逻辑清晰,且已通过 E2E 测试验证。值得关注的设计决策是遵循了 '与 ChatCompletionRequest 保持一致' 的原则,避免了为批量接口单独维护一套默认值。

#47198 [Perf] Remove redundant op for GLM 5.2

原始 PR · 作者 yewentao256 · 合并时间 2026-07-05 01:25

性能优化 重要性 6.32 洞察度 4.00

消除 GLM 5.2 稀疏注意力中冗余算子

值得合并。改动小、无风险,且是 Issue #46654 性能优化工作中清除冗余算子的典型步骤。对维护者而言,这类零碎优化在长期可积累显著的端到端加速。

2026-07-04
基础设施 重要性 5.79 洞察度 4.00

升级 huggingface-hub 至 v1.22.0,优化模型下载缓存

建议快速合入此 PR,因为依赖升级带来明确的性能收益且经过了充分测试。开发人员应注意离线场景可能出现的 IncompleteSnapshotError,并确保缓存策略的完整性。测试维护者需确认所有 gpt2 引用已更新完毕。

缺陷修复 重要性 6.05 洞察度 3.00

为 pooling 请求添加 cache_salt 非空验证

推荐阅读,可作为 Pydantic 模型校验的参考示例。变更小、风险低,可直接合并。

缺陷修复 重要性 6.20 洞察度 5.00

转发跨编码器打分请求级 prompt extras

PR 变更简洁清晰,值得精读以理解跨编码器打分的请求流。设计上清晰分离了模板级 extras(`chat_template_kwargs`)与引擎级 extras(`mm_processor_kwargs`, `cache_salt`),是一个好范例。

缺陷修复 重要性 4.79 洞察度 3.00

修复跨编码器打分时 extra_kwargs 丢失问题

值得合入,问题明确、修复干净。可作为小型 bugfix 的参考范例:优先保持与现有配置的兼容性,避免意外覆盖用户侧参数。

参与讨论