Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 18:31 同步状态:空闲 下次计划:2026-08-20 19:31

PR 列表

更多筛选
2026-07-10

#47959 [Rust Frontend] Integrate MM video support

原始 PR · 作者 BugenZhao · 合并时间 2026-07-10 16:15

功能 重要性 9.18 洞察度 6.00

Rust 前端集成视频多模态并重构模态架构

值得精读,尤其对多模态扩展和 Rust 前端架构感兴趣的读者。注意 SSRF 风险需后续修复,架构设计(`ModalitySupport` + `PreparedMedia` + `expand_prompt_token_ids`)具有良好的可扩展性,可为将来添加新模态提供参考。

基础设施 重要性 4.23 洞察度 2.00

新增 XPU 镜像的 nightly 和 release 发布流程

建议阅读此 PR 以了解 XPU 镜像发布流程的设计。如果团队计划增加其他硬件后端,可以参考此模式。值得关注的点是 `push-nightly-builds-xpu.sh` 中使用了 `docker manifest` 操作,以及如何在 pipeline 中组织依赖。

基础设施 重要性 4.99 洞察度 4.00

根据夜间CI数据调整所有测试域的超时时间

建议合并。该 PR 采用数据驱动方法精确调整超时,值得借鉴。未来可增加更频繁的自动调整机制。

#44472 [XPU] Enable v1/sample tests on XPU CI

原始 PR · 作者 chaojun-zhang · 合并时间 2026-07-10 15:40

基础设施 重要性 3.08 洞察度 2.00

XPU CI 启用 v1/sample 全量测试

该 PR 变更简单,适合快速合并。XPU 团队后续应关注 CI 执行情况,确保所有测试通过。

性能优化 重要性 6.25 洞察度 5.00

移除预分配缓冲,启用融合优化,提升 Qwen3.5 性能

值得精读,展示了一个常见的性能优化模式:移除临时缓冲区以解锁编译器融合。对于关注 Qwen3.5 模型或 PyTorch 编译优化的工程师有参考价值。

功能 重要性 8.34 洞察度 6.00

支持 non-Harmony 模型 include_reasoning 参数

建议阅读该 PR 以理解 `include_reasoning` 的完整实现分层:解析器层负责抑制推理文本,serving 层负责抑制关联元数据。尤其关注 **元数据泄漏的修复提交**(如 `e6fdc09` 和 `23e716c`),以及 `depthfirst-app` 指出的多个安全边界。该设计可复用至其他需要按需过滤响应内容的场景。

功能 重要性 8.10 洞察度 5.00

新增 full 模式报告 prefix 缓存复用 block 事件

这是一个设计干净、讨论充分的特性 PR。推荐后端和基础设施开发者精读,尤其是 `_build_block_stored_event` 的共享设计和 `resolve_block_hashes` 的提取过程,展示了良好的代码演进模式。对于使用 KV events 的外部项目(如 Dynamo、llm-d),建议关注此 PR 并测试 `full` 模式。

#40996 DCP supports hybrid attention

原始 PR · 作者 Yancey0623 · 合并时间 2026-07-10 12:34

功能 重要性 9.13 洞察度 7.00

DCP 支持混合注意力模型,非 DCP 层走本地缓存

值得精读。该 PR 是 DCP 支持混合注意力的关键里程碑,其中三处设计最值得关注:①把“分片 vs 复制”语义下沉到 `KVCacheSpec` 子类(`max_num_blocks_per_req`),解决 CP 缩放公式散落各处的问题;②rank-invariant 的 collective 门控原则(任何决定是否发起 DCP 通信的判定都必须基于全局、rank 无关的输入),这是分布式正确性的通用教训;③FA2 混合批次拆分的兼容性 workaround 思路。建议结合后续 #50823 一起阅读,观察该契约的演进。

参与讨论