#39937 [Model Runner V2] Multiple prompt logprobs support
原始 PR · 作者 yewentao256 · 合并时间 2026-04-21 23:49
V2 Model Runner 支持多个 prompt logprob
值得精读以实现差异化批处理参数的传递模式。但需留意 gemini 指出的切片缺失问题,建议在合并后续 PR 或生产环境遇到断言错误时补充每个请求的精确截断逻辑。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 yewentao256 · 合并时间 2026-04-21 23:49
V2 Model Runner 支持多个 prompt logprob
值得精读以实现差异化批处理参数的传递模式。但需留意 gemini 指出的切片缺失问题,建议在合并后续 PR 或生产环境遇到断言错误时补充每个请求的精确截断逻辑。
原始 PR · 作者 vadiklyutiy · 合并时间 2026-04-21 23:44
撤销对TRTLLM注意力后端SM100限制的临时修复,恢复SM10x家族支持。
该PR值得快速浏览,重点关注`vllm/utils/flashinfer.py`中设备能力检查的逻辑恢复,以及测试用例的同步更新。设计决策体现了“上游修复后及时清理临时补丁”的良好实践,但需注意对上游依赖的信任风险。
原始 PR · 作者 MatthewBonanni · 合并时间 2026-04-21 23:26
更新CUDA图内存分析日志中的版本号,从v0.19改为v0.21。
此PR变更简单,无需精读。值得关注的点是版本号更新的及时性,反映了项目发布计划的调整。对于了解CUDA图内存分析功能演进方向的开发者,可留意相关PR #38284。
原始 PR · 作者 roikoren755 · 合并时间 2026-04-21 22:51
默认 Mamba 缓存模式在推测解码时改为 align
值得精读,尤其是理解 Mamba 模型在不同配置下的缓存模式选择逻辑。变更简洁,但涉及对推测解码兼容性的设计权衡。
原始 PR · 作者 shen-shanshan · 合并时间 2026-04-21 22:47
优化ViT CUDA图视频推理的默认帧数自动推断,从硬编码改为模型感知。
建议技术管理者和工程师精读此PR,关注协议扩展和模型感知推断的设计决策,以及review中解决缓存问题的权衡,有助于理解vLLM多模态CUDA图路径的演进。
原始 PR · 作者 zxd1997066 · 合并时间 2026-04-21 22:30
新增Intel GPU的CI测试配置,覆盖misc、engine和lora组件。
对于负责CI基础设施、测试或Intel GPU支持的工程师,建议浏览新增的YAML配置文件以了解测试组织方式和硬件特定调整;但变更主要涉及配置和脚本调整,无需深入源码精读,可重点关注review中讨论的风险点。
原始 PR · 作者 HollowMan6 · 合并时间 2026-04-21 22:17
扩展LoRA专家权重加载逻辑,支持Qwen3.5和Step3.x模型的`.base_layer`前缀。
该PR值得精读,特别是了解LoRA权重加载中动态参数映射的设计决策,以及如何平衡向后兼容性和功能扩展。关注条件检测的实现和专家映射表的调整方式。
更新批次不变性文档,添加两个已验证的 Qwen3 AWQ 模型。
对于大多数工程师,无需精读此 PR。它仅是一个简单的文档更新。值得关注的点在于:它反映了 vLLM 项目对批次不变性功能测试覆盖的持续完善,以及文档与代码实现保持同步的实践。
参与讨论