#45391 [CPU] Refine CPU attention frontend
原始 PR · 作者 bigPYJ1151 · 合并时间 2026-06-15 10:26
CPU 注意力前端重构:移除 SDPA,ISA 检查提前,新增 head_dim 48
值得精读。该 PR 展示了 CPU 注意力后端的演进方向:统一内核、移除对 PyTorch SDPA 的依赖。对于关注 CPU 推理性能的开发者有参考价值,特别是其中的基准测试方法值得借鉴。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 bigPYJ1151 · 合并时间 2026-06-15 10:26
CPU 注意力前端重构:移除 SDPA,ISA 检查提前,新增 head_dim 48
值得精读。该 PR 展示了 CPU 注意力后端的演进方向:统一内核、移除对 PyTorch SDPA 的依赖。对于关注 CPU 推理性能的开发者有参考价值,特别是其中的基准测试方法值得借鉴。
原始 PR · 作者 maobaolong · 合并时间 2026-06-15 10:26
修复CPU容器内KV缓存大小计算错误
建议精读。本PR展示了处理Linux容器内资源感知的经典模式,代码简洁且边界处理完整(v1/v2回退、哨兵值、文件异常)。可作为在vLLM中处理cgroup限制的参考实现。
原始 PR · 作者 chaojun-zhang · 合并时间 2026-06-15 10:26
为 XPU 平台启用序列并行支持
该 PR 是 XPU 平台性能优化的重要一步,改动清晰且测试完备。建议阅读其设计决策,特别是平台无关的阈值计算抽象和自定义 op 集体通信的选用考量。对于其他平台开发者,可参考其 pass_manager 导入守卫调整模式。
流式加载 Llama4 权重修复 host OOM
建议精读此 PR,尤其是处理大型模型权重加载时的内存管理。其中的迭代器流式消费模式值得借鉴。对于部署 Llama4 的团队,应优先合并此修复。
校验 runai_streamer 加载器额外配置
建议合入,并确保 follow-up PR #47337 也一并合入以修正 `memory_limit=-1` 的边界情况。此 PR 展示了在全局状态(`os.environ`)变更前做批量校验的良好实践,值得在类似场景中推广。
原始 PR · 作者 taneem-ibrahim · 合并时间 2026-06-15 09:08
为 /v1/embeddings 添加消息形状输入与 chat_template_kwargs 支持
建议阅读该 PR 以了解 vLLM Embedding 端点如何扩展以支持聊天模板输入,特别是请求模型的设计模式(`model_validator`)和 IO Processor 的分支处理。对于需要接入类似嵌入模型的开发者具有参考价值。
修复多模态 prompt_embeds 被覆盖及异步调度兼容问题
值得精读,尤其是 `_preprocess` 中巧妙使用 `torch.where` 避免覆盖用户 embedding 的设计,以及配置层兼容性阻断模式。可与后续 PR #45673 对照阅读,了解如何逐步启用异步调度支持。
使用二分查找优化多模态特征检索
本 PR 改动量小,逻辑清晰,值得合并。建议在后续补充对该二分查找函数依赖 `offset` 有序性的断言或文档注释,降低未来重构时的误用风险。对于 MRV2 开发人员,建议在涉及多模态场景测试时确认该优化不会引入回归。
参与讨论