修复 GPT-OSS 权重加载因 MoE 重构导致的崩溃
推荐合并。改动极小、风险可控,且解决了用户可复现的模型启动崩溃问题。虽然没有新增测试,但现有 CI 和手动回归可以确保不引入新问题。
A high-throughput and memory-efficient inference and serving engine for LLMs
修复 GPT-OSS 权重加载因 MoE 重构导致的崩溃
推荐合并。改动极小、风险可控,且解决了用户可复现的模型启动崩溃问题。虽然没有新增测试,但现有 CI 和手动回归可以确保不引入新问题。
原始 PR · 作者 yewentao256 · 合并时间 2026-06-11 09:01
为 MRv2 添加 yewentao256 的 GitHub 通知
此 PR 为简单的配置变更,无需精读。但值得注意其反映了 MRv2(Model Runner V2)作为 vllm 重点开发模块,正在扩展维护团队。
修复 MLA 分块预填充元数据 H2D 拷贝阻塞问题
推荐合并。该 PR 是低风险、高收益的性能优化,修复了一个难以发现的隐式同步问题,且代码改动极小(+5/-3)。值得注意的设计教训:`non_blocking=True` 仅在源为 pinned memory 时才非阻塞,review 过程中强化了 DCP 路径的一致性。
原始 PR · 作者 DanBlanaru · 合并时间 2026-06-11 06:18
TRT-LLM 测试在非 CUDA 平台跳过
该 PR 是简单的测试维护,无精读必要。可关注其统一的跳过模式,未来类似测试可参考。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-06-11 04:26
将 CI 测试从 MI300 迁移到 MI325
作为纯粹的 CI 运维变更,无需深入审查。但值得关注的是,这是临时性迁移,未来 MI300 恢复后应有一个反向 PR 改回。可以关注后续是否有恢复 PR。
修复 AITER MoE 在 TP>1 时精度严重下降
推荐合并。该 PR 以极小的代码改动(+12/-2)修复了严重的精度回归,且经过明确的基准测试验证。值得关注的是其设计决策模式——在跨后端、跨 TP 的场景下必须显式管理 padding 约定差异。建议在升级 AITER 后及时清理 TODO 注释。
原始 PR · 作者 TheCodeWrangler · 合并时间 2026-06-11 03:55
支持 Qwen3-ASR 转录 API 的 prompt 参数
建议合入。该 PR 解决了真实用户需求(Issue #35272),同时以高安全标准处理用户输入(fixpoint 清理)。设计上保留了向后兼容,并且示例扩展降低了用户试用门槛。值得关注的决策是采用 fixpoint 而非简单正则替换来防御嵌套注入,可作为安全编码的范本。
拒绝 async EPLB 中使用 NCCL 通信器,防止挂起
值得精读,特别是 EPLB 配置验证和通信后端选择逻辑。展示了如何在分布式系统中预防多流冲突导致的死锁。
参与讨论