新增 DP 放置节点白名单,避免多引擎争抢设备
该 PR 设计简洁,适合需要多 DP 引擎共享 Ray 集群的团队精读。决策思路(环境变量白名单)值得参考,与已有 `VLLM_RAY_DP_PACK_STRATEGY` 风格一致。
A high-throughput and memory-efficient inference and serving engine for LLMs
新增 DP 放置节点白名单,避免多引擎争抢设备
该 PR 设计简洁,适合需要多 DP 引擎共享 Ray 集群的团队精读。决策思路(环境变量白名单)值得参考,与已有 `VLLM_RAY_DP_PACK_STRATEGY` 风格一致。
优化 Mergify 评论触发条件
简单修复,可快速合入。
修复 GPT-OSS 指令渲染与 HF 模板不一致
- **值得精读**:特别是 `build_harmony_preamble` 的设计和如何通过 `extract_instructions_from_messages` 抽象消息预处理逻辑。 - **关注测试**:四个 case 的渲染对比示例是验证行为的好材料。 - **留意环境变量**:`VLLM_GPT_OSS_HARMONY_SYSTEM_INSTRUCTIONS` 的行为需在部署时确认。
原始 PR · 作者 CienetStingLin · 合并时间 2026-06-06 00:12
升级 tpu-inference 依赖至 v0.21.0
该 PR 是常规依赖升级,无需精读。可快速合并。
原始 PR · 作者 Vikrantpalle · 合并时间 2026-06-05 23:51
修复 Sarvam 模型与 Transformers v5 不兼容问题
建议合并。这是一个高质量的 bugfix,方案简洁且安全,经过了 review 和测试验证。值得关注的是其设计选择:使用运行时补丁而非自定义 config 类,确保了更低的维护成本。对其他类似兼容性问题的处理有参考价值。
ROCm 回退非稳定 ABI 修复构建失败
此 PR 是必要的构建修复,值得精读以理解 vLLM 稳定 ABI 迁移策略和条件编译模式。开发者应关注 `TODO` 注释,待 ROCm 升级 torch 后系统清理回退代码。
对象存储二级KV缓存卸载层
建议花时间精读 `ObjectStoreSecondaryTierManager` 的状态机设计和异步传输管理,尤其是 `_exists()` 的探测方式和 `lookup()` 与 `submit_store()` 的配合。review中的正确性讨论(lookup返回值、ReqContext传递)值得仔细考虑。另外,配置对象化和工厂注册模式也可以作为模块扩展的参考。
MiniCPMV 批量预处理支持
建议精读,尤其是 `pad` 方法的实现和 `_convert_images_texts_to_inputs` 中批处理循环的设计。对于维护 vendored processor 的团队,此 PR 展示了如何在保持兼容性的同时扩展功能,值得借鉴。
参与讨论