Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 18:31 同步状态:空闲 下次计划:2026-08-20 19:31

PR 列表

更多筛选
2026-07-15
功能 重要性 7.07 洞察度 6.00

为 XPU 注册批次不变核函数,支持强化学习

值得精读,尤其是其跨平台 dispatch key 抽象和测试基础设施的统一设计。评审中关于 `allow_override` 的讨论提醒了 dispatch 冲突处理,是值得关注的设计细节。建议在后续 PR 中尽快补齐 matmul/linear 的注册,并移除 E2E 测试的 xfail。

缺陷修复 重要性 6.88 洞察度 8.00

重新启用 ROCm cudagraph 内存分析并修复吞吐回归

建议精读该 PR,它展示了 GPU 内存流分配对性能影响的深刻分析,以及一个优雅的修复——通过调整捕获流(而非重写内存管理)来解决问题。审查在线讨论(特别是关于 AITER 缓冲区所有权和 torch 缓存的深入技术分析)非常有价值。

功能 重要性 7.83 洞察度 3.00

新增 RoBERTa/XLM-RoBERTa 的 Token 分类支持

值得查阅以了解如何添加新的 pooling 模型。设计决策包括:通过装饰器指定 attention 类型和池化类型,复用 BertModel 并替换 embedding_class,利用 AutoWeightsLoader 自动映射权重。这展示了一种低代码复用的模型注册模式。

功能 重要性 8.05 洞察度 6.00

为 P2P KV 卸载添加可配置监听地址与 DP 级端口偏移

该 PR 值得精读,尤其是环境变量驱动的配置回退模式、DP rank 偏移端口分配、以及 NIXL agent 名称与其身份的解耦设计。Review 中关于默认值安全性的 discussion 也体现了将安全 left-shift 到 API 设计的思路。对于部署大规模 PD 分离 + 数据并行的团队,此 PR 是必需的。

参与讨论