Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 23:04 同步状态:空闲 下次计划:2026-08-22 00:04
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-06-30

#46986 [Bugfix] Fix DeepseekV2Model hidden_size

原始 PR · 作者 jeejeelee · 合并时间 2026-06-30 00:44

缺陷修复 重要性 5.25 洞察度 2.00

修复 DeepseekV2Model hidden_size 引用错误

值得合并,属于规范化修复,提升代码一致性和可维护性。建议后续考虑在相似模型中推广此模式。

性能优化 重要性 8.70 洞察度 5.00

扩展 Triton kernel warmup 覆盖,支持 DSv4 稀疏 MLA 和 block table

值得精读。该 PR 展示了如何系统地为 Triton JIT kernel 添加启动预热,包含 backend 检测、参数空间枚举、条件过滤等模式。特别关注 `sparse_mla_triton_warmup.py` 中的 backend 识别和参数组合设计,以及审核中关于 MRv1/MRv2 差异的处理。可作为后续模型特定预热功能开发的参考。

#46683 Bump flashinfer version to 0.6.13

原始 PR · 作者 wzhao18 · 合并时间 2026-06-30 00:30

基础设施 重要性 6.43 洞察度 5.00

FlashInfer升级0.6.13并启用持久缓存

建议仔细审阅`flashinfer_autotune`函数中DeepEP的判断逻辑,确认覆盖了所有相关的all2all后端。同时关注FlashInfer上游后续是否彻底解决持久缓存问题,届时可移除特判。GSM8K超时调整作为配套,无特别风险。

#46756 Add MiniMax-M3 modelopt nvfp4 support

原始 PR · 作者 jasonlizhengjian · 合并时间 2026-06-30 00:29

功能 重要性 7.56 洞察度 6.00

添加 MiniMax-M3 NVFP4 量化支持

值得精读,特别是 Per-expert 参数 fallback 和注册的设计模式,以及混合精度配置中的 parent-prefix fallback 策略,可作为为特定模型添加量化支持的良好范例。

性能优化 重要性 7.35 洞察度 6.00

C扩展批量文件存在性检查,释放GIL提升KV offload查找性能

该PR适合关注KV offload性能的开发者精读,尤其学习C扩展与Python fallback结合的设计模式、`Py_BEGIN_ALLOW_THREADS`的使用场景。构建系统团队也可参考CMakeLists中扩展注册的方式。

2026-06-29
缺陷修复 重要性 6.38 洞察度 4.00

修复 W8A8 int8 静态量化方案选择回归

建议立即合入。修复简洁明确,测试覆盖完整(含正向和反向验证),端到端验证通过。设计启示:量化方案路由条件应通过参数化测试严格覆盖,类似回归可通过条件分支变更规范化审查避免。

缺陷修复 重要性 7.73 洞察度 4.00

回退线程式 mmap pinning 以修复 CUDA Graph 挂起

该 PR 值得仔细阅读,因为它揭示了 CUDA Graph capture 与内存操作的严格同步要求。设计决策上,在正确性与微性能优化之间选择了正确性。建议关注后续是否会有更完善的异步方案加入。

参与讨论