Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-22 00:42 同步状态:空闲 下次计划:2026-08-22 01:42
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-06-15

#45391 [CPU] Refine CPU attention frontend

原始 PR · 作者 bigPYJ1151 · 合并时间 2026-06-15 10:26

重构 重要性 8.32 洞察度 5.00

CPU 注意力前端重构:移除 SDPA,ISA 检查提前,新增 head_dim 48

值得精读。该 PR 展示了 CPU 注意力后端的演进方向:统一内核、移除对 PyTorch SDPA 的依赖。对于关注 CPU 推理性能的开发者有参考价值,特别是其中的基准测试方法值得借鉴。

缺陷修复 重要性 7.17 洞察度 5.00

修复CPU容器内KV缓存大小计算错误

建议精读。本PR展示了处理Linux容器内资源感知的经典模式,代码简洁且边界处理完整(v1/v2回退、哨兵值、文件异常)。可作为在vLLM中处理cgroup限制的参考实现。

功能 重要性 7.17 洞察度 6.00

为 XPU 平台启用序列并行支持

该 PR 是 XPU 平台性能优化的重要一步,改动清晰且测试完备。建议阅读其设计决策,特别是平台无关的阈值计算抽象和自定义 op 集体通信的选用考量。对于其他平台开发者,可参考其 pass_manager 导入守卫调整模式。

缺陷修复 重要性 7.14 洞察度 6.00

校验 runai_streamer 加载器额外配置

建议合入,并确保 follow-up PR #47337 也一并合入以修正 `memory_limit=-1` 的边界情况。此 PR 展示了在全局状态(`os.environ`)变更前做批量校验的良好实践,值得在类似场景中推广。

功能 重要性 8.39 洞察度 5.00

为 /v1/embeddings 添加消息形状输入与 chat_template_kwargs 支持

建议阅读该 PR 以了解 vLLM Embedding 端点如何扩展以支持聊天模板输入,特别是请求模型的设计模式(`model_validator`)和 IO Processor 的分支处理。对于需要接入类似嵌入模型的开发者具有参考价值。

2026-06-14
缺陷修复 重要性 7.08 洞察度 6.00

修复多模态 prompt_embeds 被覆盖及异步调度兼容问题

值得精读,尤其是 `_preprocess` 中巧妙使用 `torch.where` 避免覆盖用户 embedding 的设计,以及配置层兼容性阻断模式。可与后续 PR #45673 对照阅读,了解如何逐步启用异步调度支持。

性能优化 重要性 5.94 洞察度 4.00

使用二分查找优化多模态特征检索

本 PR 改动量小,逻辑清晰,值得合并。建议在后续补充对该二分查找函数依赖 `offset` 有序性的断言或文档注释,降低未来重构时的误用风险。对于 MRV2 开发人员,建议在涉及多模态场景测试时确认该优化不会引入回归。

参与讨论