Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 18:31 同步状态:空闲 下次计划:2026-08-20 19:31

PR 列表

更多筛选
2026-07-01

#41396 Add Medusa speculative decoding e2e test

原始 PR · 作者 puririshi98 · 合并时间 2026-07-01 02:02

测试 重要性 7.21 洞察度 6.00

新增 Medusa 投机解码端到端测试

值得精读,特别是对投机解码测试设计和旧检查点兼容性处理的关注。`_remap_old_checkpoint_key` 的实现和配置注入方式可作为处理类似新旧格式不兼容问题的参考。

缺陷修复 重要性 8.73 洞察度 7.00

自动发现特殊 token 并阻止泄漏,修复非流式工具解析 bug

值得精读。设计决策值得关注:自动发现 vs 手动配置的权衡,preserve_tokens 机制提供可扩展性,抑制工具调用与跳过语义的分离。建议在引入新解析器时参考 `_build_drop_info` 和 `preserve_tokens` 的设计。

基础设施 重要性 5.01 洞察度 4.00

将分布式小模型 LM eval 从 2xL4 迁移到 2xB200 并增加 DiffusionGemma chat completions 支持

该 PR 属于常规 CI 维护,代码简单清晰,合并迅速。建议关注 CI 硬件迁移的策略,以及 chat completions 端点适配的模式,可作为后续类似评测扩展的参考。

功能 重要性 7.63 洞察度 6.00

EP all2all 通信故障检测与异常终止

该 PR 是 fault tolerance 关键基础设施,值得所有 MoE 部署团队精读。设计决策(类变量使用、开关控制、异步安全性)体现了 real system 的权衡。建议关注后续 #44428 的 recovery 实现。

2026-06-30
重构 重要性 6.78 洞察度 4.00

全局替换 torch.cuda.Event 为 torch.Event,提升硬件兼容性

建议合并。此 PR 是多硬件兼容性迁移的一部分,代码变更清晰,review 充分,风险低。合并后建议快速跟进后续 API 替换(如 `torch.cuda.Stream`)。

参与讨论