修复批量聊天采样参数覆盖问题
这是一个小而关键的 bugfix,建议合并。代码变更量少(4 行增加值、4 行删除值),逻辑清晰,且已通过 E2E 测试验证。值得关注的设计决策是遵循了 '与 ChatCompletionRequest 保持一致' 的原则,避免了为批量接口单独维护一套默认值。
A high-throughput and memory-efficient inference and serving engine for LLMs
修复批量聊天采样参数覆盖问题
这是一个小而关键的 bugfix,建议合并。代码变更量少(4 行增加值、4 行删除值),逻辑清晰,且已通过 E2E 测试验证。值得关注的设计决策是遵循了 '与 ChatCompletionRequest 保持一致' 的原则,避免了为批量接口单独维护一套默认值。
原始 PR · 作者 yewentao256 · 合并时间 2026-07-05 01:25
消除 GLM 5.2 稀疏注意力中冗余算子
值得合并。改动小、无风险,且是 Issue #46654 性能优化工作中清除冗余算子的典型步骤。对维护者而言,这类零碎优化在长期可积累显著的端到端加速。
修复 Harmony 解析器非终止状态内容丢失
建议立即合并。此 PR 解决了 issue #45736 报告的静默数据丢失问题,设计简洁,测试完善,且已获得审阅者 bbrowning 和 mgoin 的批准。
升级 huggingface-hub 至 v1.22.0,优化模型下载缓存
建议快速合入此 PR,因为依赖升级带来明确的性能收益且经过了充分测试。开发人员应注意离线场景可能出现的 IncompleteSnapshotError,并确保缓存策略的完整性。测试维护者需确认所有 gpt2 引用已更新完毕。
原始 PR · 作者 taneem-ibrahim · 合并时间 2026-07-04 22:19
为 pooling 请求添加 cache_salt 非空验证
推荐阅读,可作为 Pydantic 模型校验的参考示例。变更小、风险低,可直接合并。
原始 PR · 作者 taneem-ibrahim · 合并时间 2026-07-04 22:19
补全批量聊天请求缺少的请求扩展字段
变更简洁、安全,可以直接合并,无需深度精读。但对理解 vLLM 批量请求与单请求的字段对齐策略有一定参考价值。
原始 PR · 作者 taneem-ibrahim · 合并时间 2026-07-04 22:18
转发跨编码器打分请求级 prompt extras
PR 变更简洁清晰,值得精读以理解跨编码器打分的请求流。设计上清晰分离了模板级 extras(`chat_template_kwargs`)与引擎级 extras(`mm_processor_kwargs`, `cache_salt`),是一个好范例。
原始 PR · 作者 taneem-ibrahim · 合并时间 2026-07-04 20:14
修复跨编码器打分时 extra_kwargs 丢失问题
值得合入,问题明确、修复干净。可作为小型 bugfix 的参考范例:优先保持与现有配置的兼容性,避免意外覆盖用户侧参数。
参与讨论