Triton 融合替代 torch.compile 修复 MiniMax 性能回归
值得精读,尤其关注如何用 Triton 手动替代 torch.compile 进行算子融合的方案,可作为类似性能优化案例的参考。
A high-throughput and memory-efficient inference and serving engine for LLMs
Triton 融合替代 torch.compile 修复 MiniMax 性能回归
值得精读,尤其关注如何用 Triton 手动替代 torch.compile 进行算子融合的方案,可作为类似性能优化案例的参考。
支持 DFlash 混合 KV 页面大小的填充与 reshape
推荐精读的设计决策: - 如何用 `indexes_kv_by_block_stride` 统一两种需要非连续 block stride 的场景(跨层统一布局和填充页面布局)。 - 填充 vs 放大 block size 的权衡选择和实现细节。 - `_reshape_attention_kv_cache` 的 strided view 计算方式,尤其是对 num-blocks-first 布局的适配。 - 测试设计:覆盖 FlashAttention、HND、DiffKV 三种不同 stride order 的后端。
流式生成响应添加 MoE 路由信息
值得精读以了解 vLLM disagg 服务中 MoE 路由数据的序列化与传输模式。代码简洁,设计意图清晰,是良好的功能补充范例。
原始 PR · 作者 junkang1991 · 合并时间 2026-06-21 20:55
修复 MoRIIO READ 下混合 KV 布局的传输偏移
该 PR 代码质量高,将布局逻辑抽象为独立模块,并通过 `KVCacheSpec` 驱动而非硬编码形状模式。建议阅读 `moriio_layout.py` 中的几何计算逻辑,了解如何支持多种缓存布局的偏移量推导。社区开发者可参考此模式添加新的布局支持。
原始 PR · 作者 Palaiologos1453 · 合并时间 2026-06-21 19:30
延迟预占用重入请求的 KV 加载直到传输完成
值得精读,展示了在异步调度框架下如何优雅处理预占用与传输作业重叠的边界情况。
原始 PR · 作者 wentian-byte · 合并时间 2026-06-21 15:11
替换因 transformers 5.x 兼容性失败的测试模型
该 PR 是典型的 CI 环境适配,值得关注的是其揭示了 transformers 5.x 对 tokenizer 加载策略的 breaking change,未来引入新模型时需注意 `tokenizer.json` 的存在性。
修复 Mamba 状态缓冲区内存指针溢出
值得精读,尤其关注审核者提出的“统一所有平台”决策。该 PR 展示了如何处理跨平台的内存地址符号性问题,对于理解 vLLM 的 GPU 内存管理有启发意义。
修复 V2 GPU sampler 中 min_tokens 少 1 的 off-by-one 错误
建议立即合入,这是明确的 bug 修复。开发者可以关注是否有必要为此添加单元测试,以覆盖 min_tokens 边界条件。
参与讨论