澄清 BlockPool.free_blocks 驱逐优先级注释与命名
无需精读,但值得快速浏览 free_blocks 的新注释,以理解 v1 前缀缓存中缓存块与非缓存块的驱逐优先级设计(LIFO vs FIFO)。
A high-throughput and memory-efficient inference and serving engine for LLMs
澄清 BlockPool.free_blocks 驱逐优先级注释与命名
无需精读,但值得快速浏览 free_blocks 的新注释,以理解 v1 前缀缓存中缓存块与非缓存块的驱逐优先级设计(LIFO vs FIFO)。
原始 PR · 作者 yewentao256 · 合并时间 2026-08-13 11:33
修复 24 个 c/d 开头模型文件的 mypy 类型错误
值得快速阅读,作为 mypy 全量覆盖的样板 PR。重点看 dbrx.py 与 deepseek_v2.py 的加载器契约统一、cosmos3_edge.py 的命名对齐、cohere_asr.py 的潜在行为修正;若你维护下游模型或 fork,需要特别关注 DbrxExperts.weight_loader 签名变化。
原始 PR · 作者 ziqifan617 · 合并时间 2026-08-13 11:28
CPU KV 事件改为按 KV-group 块粒度发布
建议精读。该 PR 展示了一个典型的“事件发布粒度与存储索引粒度不一致”的修复,`resolve_block_hashes()` 在 GPU 与 CPU 事件路径的复用是值得关注的设计决策;对 KV 事件消费者实现、混合 KV cache 布局支持都有参考价值。改动集中、测试覆盖到位,合并风险低。
原始 PR · 作者 ziqifan617 · 合并时间 2026-08-13 11:27
向 KV Offload 后端透传 DP 拓扑配置
值得快速浏览。PR 本身改动极小(8 个文件、23 行新增),但它是 KV offloading DP 拓扑信息补全的关键一步,为后续实现 DP-aware 的 offloading 布局/路由提供必要条件。值得关注:`data_parallel_rank_local` 的 `None` 语义约定,以及新增必填字段对第三方后端的兼容性影响。
修复 EPLB 平衡度统计轴错误并补回归测试
值得快速精读。该 PR 展示了“指标统计轴选错导致误报”的典型修复路径:抽取纯函数、修正 dtype/维度归约、并用一个构造极端的回归测试锁定行为。对从事分布式训练推理或负载均衡相关工作的工程师,这个测试用例是很好的维度错误捕捉范例。
原始 PR · 作者 Akashcodes732 · 合并时间 2026-08-13 10:56
为 Power 架构添加 VSX 未量化 MoE 后端
值得精读,特别是 `cpu_micro_gemm_vsx.hpp` 中的 MMA 指令使用和优化过程(25 个提交中有大量性能调优)。关注其如何在统一接口下插入架构特定实现,以及如何在测试中启用。
将外部测试资源镜像到 vLLM S3,消除 CI 对第三方主机依赖
值得快速浏览:本 PR 展示了如何系统性消除 CI 对第三方主机的依赖,其中"统一 VLLM_S3_BUCKET_URL 常量 + 动态推导 SSRF 白名单"的做法值得借鉴。若后续出现新的外部资源依赖,可按同样模式迁移。
原始 PR · 作者 stefankoncarevic · 合并时间 2026-08-13 09:33
恢复 _fused_wqa_wkv_gemm 覆写点,修复 ROCm 上 DeepSeek-V4 输出乱码
值得精读。这是一个小而典型的“性能优化删除公共覆写点导致平台特定数值回归”案例:8 行修复背后是 ROCm 权重 preshuffle 与 AITER GEMM 的深层契约。建议关注三点:一是平台覆写方法应被视为稳定接口,性能内联前需检查子类覆写;二是跨平台回归难以被 CUDA CI 发现,ROCm 专项测试需覆盖此类模型精度;三是 PR body 中“与 #51750/#51768 独立但需协调”的问题拆解方式,适合作为多平台回归处理模板。
参与讨论