降级 triton_kernels 到 v3.5.1 恢复 GPT-OSS 解码性能
此 PR 值得精读,尤其是 `triton_kernel_moe_forward` 中的路由分支选择(`if use_legacy_triton_kernels and expert_map is None`)展示了如何在不破坏新 API 的前提下回滚关键优化。设计上通过 import 时判断 API 版本来选择路径,是一种干净的兼容性模式。未来需要关注上游修复后如何平滑过渡回 v3.6.0+。
A high-throughput and memory-efficient inference and serving engine for LLMs
降级 triton_kernels 到 v3.5.1 恢复 GPT-OSS 解码性能
此 PR 值得精读,尤其是 `triton_kernel_moe_forward` 中的路由分支选择(`if use_legacy_triton_kernels and expert_map is None`)展示了如何在不破坏新 API 的前提下回滚关键优化。设计上通过 import 时判断 API 版本来选择路径,是一种干净的兼容性模式。未来需要关注上游修复后如何平滑过渡回 v3.6.0+。
原始 PR · 作者 dllehr-amd · 合并时间 2026-05-21 05:10
更新 CODEOWNERS 与 committers 列表
可快速合并,注意 review 评论中的小建议(如迁移 gshtras 至 Emeritus Committers 可后续跟进)。
修复 FlashInfer NVFP4 内核缺少的导入
该 PR 为低风险、高价值的修复,建议快速合并。同时值得团队反思:如何避免跨 PR 的导入依赖被意外删除,例如通过更严格的 import 审计或 CI 中运行更完整的 mypy 覆盖。
原始 PR · 作者 yewentao256 · 合并时间 2026-05-21 02:57
提取权重padding到预加载,TTFT提升13.5%
该 PR 展示了典型的“预计算代替运行时计算”性能优化模式,值得阅读。合并前需确认缩放因子形状问题已排查,建议增加单元测试覆盖预加载逻辑。对于同类性能优化场景有参考价值。
原始 PR · 作者 meena-at-work · 合并时间 2026-05-21 01:21
为 SM12x GPU 集成 FlashInfer b12x MoE 和 FP4 GEMM 后端
值得精读:该 PR 展示了如何将第三方自定义 kernel 后端集成到 vLLM 现有的量化 MoE 和 Linear 架构中,特别是 `process_weights_after_loading` 中的 scale 融合技巧。review 讨论中关于设计权衡 — 独立 backend 与复用 — 的对话也值得参考。
降低 hybrid SSM PD 精度测试阈值以容忍内核变更导致的抖动
I 建议合入以解锁 CI,但同时需要创建 issue 跟踪 `chunk_scan` 与 `selective_state_update` 内核的数值差异修复,并在修复后及时回调精度阈值。
在 OpenAI 端点中添加 routed_experts 字段
值得关注的设计决策包括:使用 .npy + base64 作为序列化方案(相比 JSON 数组更紧凑),以及在协议模型中为字段添加详尽文档说明形状和空值条件。
原始 PR · 作者 vadiklyutiy · 合并时间 2026-05-20 23:50
修复对称内存大小边界误回退,新增后端日志
值得阅读,尤其是涉及分布式通信后端选择逻辑的开发者。该 PR 展示了如何通过启动日志提升复杂组件可观测性,并修复了一个边界 bug。
参与讨论