流式生成响应添加 MoE 路由信息
值得精读以了解 vLLM disagg 服务中 MoE 路由数据的序列化与传输模式。代码简洁,设计意图清晰,是良好的功能补充范例。
A high-throughput and memory-efficient inference and serving engine for LLMs
流式生成响应添加 MoE 路由信息
值得精读以了解 vLLM disagg 服务中 MoE 路由数据的序列化与传输模式。代码简洁,设计意图清晰,是良好的功能补充范例。
原始 PR · 作者 junkang1991 · 合并时间 2026-06-21 20:55
修复 MoRIIO READ 下混合 KV 布局的传输偏移
该 PR 代码质量高,将布局逻辑抽象为独立模块,并通过 `KVCacheSpec` 驱动而非硬编码形状模式。建议阅读 `moriio_layout.py` 中的几何计算逻辑,了解如何支持多种缓存布局的偏移量推导。社区开发者可参考此模式添加新的布局支持。
原始 PR · 作者 Palaiologos1453 · 合并时间 2026-06-21 19:30
延迟预占用重入请求的 KV 加载直到传输完成
值得精读,展示了在异步调度框架下如何优雅处理预占用与传输作业重叠的边界情况。
原始 PR · 作者 wentian-byte · 合并时间 2026-06-21 15:11
替换因 transformers 5.x 兼容性失败的测试模型
该 PR 是典型的 CI 环境适配,值得关注的是其揭示了 transformers 5.x 对 tokenizer 加载策略的 breaking change,未来引入新模型时需注意 `tokenizer.json` 的存在性。
修复 Mamba 状态缓冲区内存指针溢出
值得精读,尤其关注审核者提出的“统一所有平台”决策。该 PR 展示了如何处理跨平台的内存地址符号性问题,对于理解 vLLM 的 GPU 内存管理有启发意义。
修复 V2 GPU sampler 中 min_tokens 少 1 的 off-by-one 错误
建议立即合入,这是明确的 bug 修复。开发者可以关注是否有必要为此添加单元测试,以覆盖 min_tokens 边界条件。
原始 PR · 作者 mawong-amd · 合并时间 2026-06-21 12:13
修复NVFP4/OCP MX MoE模拟双重量化问题
该PR值得关注,因为它揭示了PR #42120 引入的隐蔽bug,以及review过程中对scale选取逻辑的深入讨论。建议合并并密切跟踪相关的OCP MX修复PR #46142。
确保异步 H2D 复制前内存固定
值得精读,特别是 `async_tensor_h2d` 的新实现和内存固定策略的统一,对于理解 vLLM 的异步传输方式有帮助。
参与讨论