Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-22 00:42 同步状态:空闲 下次计划:2026-08-22 01:42

PR 列表

更多筛选
2026-06-11
缺陷修复 重要性 5.61 洞察度 3.00

修复 GPT-OSS 权重加载因 MoE 重构导致的崩溃

推荐合并。改动极小、风险可控,且解决了用户可复现的模型启动崩溃问题。虽然没有新增测试,但现有 CI 和手动回归可以确保不引入新问题。

性能优化 重要性 6.00 洞察度 6.00

修复 MLA 分块预填充元数据 H2D 拷贝阻塞问题

推荐合并。该 PR 是低风险、高收益的性能优化,修复了一个难以发现的隐式同步问题,且代码改动极小(+5/-3)。值得注意的设计教训:`non_blocking=True` 仅在源为 pinned memory 时才非阻塞,review 过程中强化了 DCP 路径的一致性。

缺陷修复 重要性 6.63 洞察度 6.00

修复 AITER MoE 在 TP>1 时精度严重下降

推荐合并。该 PR 以极小的代码改动(+12/-2)修复了严重的精度回归,且经过明确的基准测试验证。值得关注的是其设计决策模式——在跨后端、跨 TP 的场景下必须显式管理 padding 约定差异。建议在升级 AITER 后及时清理 TODO 注释。

功能 重要性 7.85 洞察度 6.00

支持 Qwen3-ASR 转录 API 的 prompt 参数

建议合入。该 PR 解决了真实用户需求(Issue #35272),同时以高安全标准处理用户输入(fixpoint 清理)。设计上保留了向后兼容,并且示例扩展降低了用户试用门槛。值得关注的决策是采用 fixpoint 而非简单正则替换来防御嵌套注入,可作为安全编码的范本。

缺陷修复 重要性 6.77 洞察度 4.00

拒绝 async EPLB 中使用 NCCL 通信器,防止挂起

值得精读,特别是 EPLB 配置验证和通信后端选择逻辑。展示了如何在分布式系统中预防多流冲突导致的死锁。

参与讨论