Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 18:24 同步状态:空闲 下次计划:2026-08-21 19:24

PR 列表

更多筛选
2026-05-21
性能优化 重要性 6.84 洞察度 5.00

降级 triton_kernels 到 v3.5.1 恢复 GPT-OSS 解码性能

此 PR 值得精读,尤其是 `triton_kernel_moe_forward` 中的路由分支选择(`if use_legacy_triton_kernels and expert_map is None`)展示了如何在不破坏新 API 的前提下回滚关键优化。设计上通过 import 时判断 API 版本来选择路径,是一种干净的兼容性模式。未来需要关注上游修复后如何平滑过渡回 v3.6.0+。

缺陷修复 重要性 4.20 洞察度 3.00

修复 FlashInfer NVFP4 内核缺少的导入

该 PR 为低风险、高价值的修复,建议快速合并。同时值得团队反思:如何避免跨 PR 的导入依赖被意外删除,例如通过更严格的 import 审计或 CI 中运行更完整的 mypy 覆盖。

提取权重padding到预加载,TTFT提升13.5%

该 PR 展示了典型的“预计算代替运行时计算”性能优化模式,值得阅读。合并前需确认缩放因子形状问题已排查,建议增加单元测试覆盖预加载逻辑。对于同类性能优化场景有参考价值。

功能 重要性 9.18 洞察度 8.00

为 SM12x GPU 集成 FlashInfer b12x MoE 和 FP4 GEMM 后端

值得精读:该 PR 展示了如何将第三方自定义 kernel 后端集成到 vLLM 现有的量化 MoE 和 Linear 架构中,特别是 `process_weights_after_loading` 中的 scale 融合技巧。review 讨论中关于设计权衡 — 独立 backend 与复用 — 的对话也值得参考。

测试 重要性 3.83 洞察度 6.00

降低 hybrid SSM PD 精度测试阈值以容忍内核变更导致的抖动

I 建议合入以解锁 CI,但同时需要创建 issue 跟踪 `chunk_scan` 与 `selective_state_update` 内核的数值差异修复,并在修复后及时回调精度阈值。

功能 重要性 7.50 洞察度 5.00

在 OpenAI 端点中添加 routed_experts 字段

值得关注的设计决策包括:使用 .npy + base64 作为序列化方案(相比 JSON 数组更紧凑),以及在协议模型中为字段添加详尽文档说明形状和空值条件。

2026-05-20
缺陷修复 重要性 6.57 洞察度 4.00

修复对称内存大小边界误回退,新增后端日志

值得阅读,尤其是涉及分布式通信后端选择逻辑的开发者。该 PR 展示了如何通过启动日志提升复杂组件可观测性,并修复了一个边界 bug。

参与讨论