#46254 [Bugfix] Fix NVFP4/OCP MX MoE emulation
原始 PR · 作者 mawong-amd · 合并时间 2026-06-21 12:13
修复NVFP4/OCP MX MoE模拟双重量化问题
该PR值得关注,因为它揭示了PR #42120 引入的隐蔽bug,以及review过程中对scale选取逻辑的深入讨论。建议合并并密切跟踪相关的OCP MX修复PR #46142。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 mawong-amd · 合并时间 2026-06-21 12:13
修复NVFP4/OCP MX MoE模拟双重量化问题
该PR值得关注,因为它揭示了PR #42120 引入的隐蔽bug,以及review过程中对scale选取逻辑的深入讨论。建议合并并密切跟踪相关的OCP MX修复PR #46142。
确保异步 H2D 复制前内存固定
值得精读,特别是 `async_tensor_h2d` 的新实现和内存固定策略的统一,对于理解 vLLM 的异步传输方式有帮助。
原始 PR · 作者 umut-polat · 合并时间 2026-06-21 07:57
修复两处过时文档引用
PR 改动简单明确,无功能影响,值得合并以改善文档准确性。不建议精读。
修复 derender 的 U+FFFD 并添加推理/工具解析
建议精读 `vllm/entrypoints/serve/render/serving.py` 中的 `_correct_decoded_token` 和 `_resolve_logprobs` 实现,理解利用 `tokenizer.decode()` 上下文修复 FFFD 的巧妙方法。同时关注 `derender_chat_response` 中的 parser 接入逻辑,可作为其他端点集成 parser 的参考。测试用例的 e2e roundtrip fixture 也值得学习。
原始 PR · 作者 amanchugh89 · 合并时间 2026-06-21 06:36
跳过非异步/V2调度器下 all_token_ids 复制
值得合并的低风险性能优化。实现简洁,测试充分,reviewer 已批准。对于关注调度性能或 V2 runner 迁移的团队,可精读调度器中的条件守卫变化。
原始 PR · 作者 jonathanc-n · 合并时间 2026-06-21 06:01
SimpleCPUOffload 添加 PCP/DCP 支持
推荐开发者和技术管理者精读此 PR,特别是理解如何利用已有 `KVCacheCoordinator` 的 CP 支持通过简单缩放块大小来扩展 offload 功能。这是一次增量扩展的典型例子,展示了最小入侵式修改。同时,测试辅助函数的组织方式值得参考。
紧凑 chunk-hash key 与零拷贝查找线格式,降低 Mooncake KV-Connector 前缀查找开销
值得精读,尤其是 `_CompactChunkHashList` 利用链式 hash 唯一性的设计思想,以及 `BlobBlockHashes` 惰性序列实现零拷贝的方式。此类针对线格式和 key 压缩的微优化对分布式 KV 传输场景有示范意义。
原始 PR · 作者 varun-sundar-rabindranath · 合并时间 2026-06-21 05:21
暴露 CPU KV 卸载缓存使用百分比指标
值得精读,尤其是 `get_stats` 中的计算逻辑与阈值联动方式。设计讨论也值得关注:指标定义应该由 Spec 集中管理还是允许 Manager 自主注册?该 PR 选择了前者(通过 Spec 的 `build_metric_definitions`),并通过 `CPUOffloadingMetrics` 集中常量,是一个合理折衷。
参与讨论