#50144 [CPU] Fix s390x builds and update torch version in dockerfile
原始 PR · 作者 R3hankhan123 · 合并时间 2026-07-29 12:52
修复 s390x 构建并升级 Docker 中 PyTorch 版本
该 PR 是针对特定平台(s390x)的修复和依赖升级,内容明确,风险低。建议合并。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 R3hankhan123 · 合并时间 2026-07-29 12:52
修复 s390x 构建并升级 Docker 中 PyTorch 版本
该 PR 是针对特定平台(s390x)的修复和依赖升级,内容明确,风险低。建议合并。
原始 PR · 作者 philippesic · 合并时间 2026-07-29 12:34
添加 CachePolicyFactory 支持可插拔缓存策略
值得精读,展示了遵循已有工厂模式(OffloadingSpecFactory)进行一致扩展的实践。review 中对 out-of-tree 加载的设计决策有参考意义。建议同时关注后续对 `OffloadingSpec` 警告位置的统一调整。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-07-29 12:27
稳定 Qwen2-VL LoRA 测试的确定性
值得精读,特别是需要理解 Triton LoRA kernel 非确定性根源和 `VLLM_BATCH_INVARIANT` 作用的工程师。此 PR 展示了如何用最小的测试配置变更解决 CI 不稳定问题。
标准化VLLM异常层次,统一错误响应与状态码
建议所有 vLLM 贡献者阅读此 PR 以理解新的异常层次设计,并在后续开发中遵循 `VLLMClientError` / `VLLMServerError` 的划分创建新异常。特别推荐关注 `vllm/exceptions.py` 和 `vllm/entrypoints/openai/api_server.py` 中的异常处理注册方式。
支持混合MLA+SSM模型的NIXL P/D KV传输
值得精读,特别是HMA去重路径中MLA标志的合并逻辑、推送写入中attention组复用的设计,以及handshake验证中对混合架构的严格检查。这些设计决策体现了对异构TP几何的精细处理。
原始 PR · 作者 danielafrimi · 合并时间 2026-07-29 10:46
CuTeDSL MoE 后端支持 ReLU2 NVFP4 激活
推荐阅读。设计上根据激活类型条件处理权重布局是一个值得记录的模式;PR 配合清晰的注释和测试,方便后续扩展其他激活函数。
QUTLASS 内核集成 NVFP4 在线变换
**值得精读**。该 PR 展示了如何安全包装第三方自定义算子、通过 `torch.library.custom_op` 拓展算子并注册假实现、以及将运行时计算融合到权重加载中。对从事量化 kernel 集成的工程师有直接的参考价值。 **关注点**:`safeFusedQuantizeNv` 的设计模式;`process_weights_after_loading` 中的缩放因子推导;`_get_flashinfer_gemm_backend` 的动态后端推断。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-07-29 10:29
修复 ROCm 上 spec decode 测试的间歇性故障
该 PR 是典型的 CI 稳定性修复,技术价值有限但对 ROCm 持续集成很重要。建议合并。
参与讨论