融合 MLA 的 RoPE 与 KV 缓存更新以减少 kernel launch
建议在更多后端(FlashInfer、原生 PyTorch)上运行性能基准测试,并将该融合加入 CI E2E 测试。对于关注 MLA 推理优化或编译 pass 编写的开发者,此 PR 的模式匹配和 defunctionalization 处理具有学习价值。
A high-throughput and memory-efficient inference and serving engine for LLMs
融合 MLA 的 RoPE 与 KV 缓存更新以减少 kernel launch
建议在更多后端(FlashInfer、原生 PyTorch)上运行性能基准测试,并将该融合加入 CI E2E 测试。对于关注 MLA 推理优化或编译 pass 编写的开发者,此 PR 的模式匹配和 defunctionalization 处理具有学习价值。
KV Offload 连接器声明 HND 布局
该 PR 变更简单明确,值得关注的是其作为 #33689 系列拆分的实践。对于理解 vLLM KV 缓存布局体系有参考价值。
修复 Nemotron Nano VL 权重加载损坏
建议精读该 PR,特别是生成器耗尽和多模态权重克隆的设计,可作为多模态模型权重加载的参考模式。
原始 PR · 作者 chaunceyjiang · 合并时间 2026-05-11 19:59
Responses API 支持 chat_template_kwargs 传递
该 PR 值得精读,展示了如何为 Responses API 增加参数透传能力的简洁实现,尤其在默认值与请求值合并的设计上值得借鉴。
修复 EXAONE 4.5 与 Transformers 更新对齐
值得精读,特别是 EXAONE 4.5 模型维护者。建议在后续 PR 中修复 review 指出的两个问题:MTP 层前缀偏移和 PP 分片。当前版本对于非 PP 单卡用户是安全的,PP 用户应暂缓使用 MTP 模式。
Python-only 安装测试改为可选步骤
该 PR 改动极小且合理,建议合并。对于超时问题的建议,可考虑在后续 PR 中评估是否需要增加时间。
原始 PR · 作者 NickLucche · 合并时间 2026-05-11 17:37
修复 NIXL 握手失败回退策略不生效
建议阅读此 PR,重点关注其线程安全失败处理模式:使用 `queue.Queue` 替代普通 set 进行跨线程通信,以及将多个失败路径收敛到 `_handle_failed_transfer` 的设计。同时注意 `_read_blocks_for_req` 中遗留的竞态条件,可作为后续改进方向。
原始 PR · 作者 NickLucche · 合并时间 2026-05-11 17:27
新增NIXL心跳租约续期,优化KV块保留时间
值得所有关注分布式 KV 传输的开发者精读。设计上展示了典型的租约续期模式,接口抽象和配置简化决策值得借鉴。建议重点阅读 `scheduler.py` 的 `on_new_request`/`_stop_heartbeat` 和 `worker.py` 的 `_ensure_handshake`/`_send_heartbeats`,体会如何在分布式组件间实现轻量级心跳协议。
参与讨论