#42567 [CI] Add NIXL EP import canary
原始 PR · 作者 alec-flowers · 合并时间 2026-05-18 10:11
NIXL EP 导入金丝雀测试,验证 CUDA 运行时链接一致性
建议阅读 test_nixl_imports.py 的实现,了解如何通过 `ldd` 命令在测试中验证动态链接库的依赖是否符合预期。这种金丝雀测试模式值得借鉴,可以在类似的多版本 CUDA 包冲突场景中复用。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 alec-flowers · 合并时间 2026-05-18 10:11
NIXL EP 导入金丝雀测试,验证 CUDA 运行时链接一致性
建议阅读 test_nixl_imports.py 的实现,了解如何通过 `ldd` 命令在测试中验证动态链接库的依赖是否符合预期。这种金丝雀测试模式值得借鉴,可以在类似的多版本 CUDA 包冲突场景中复用。
原始 PR · 作者 qianlihuang · 合并时间 2026-05-18 09:57
将 SiLU+Mul 与 FP8 块量化融合,提升 MiniMax-M2 MoE 性能
值得精读,尤其是条件融合的设计模式。虽然 review 中暴露了 block_shape 类型鲁棒性等细节问题,但整体思路清晰。建议后续开发者注意将 `self.block_shape` 可能为 None 或 tuple 的类型信息明确化,并考虑为 DeepGEMM E8M0 路径添加等效的 fused kernel 或统一量化接口。
原始 PR · 作者 ProExpertProg · 合并时间 2026-05-18 03:49
为torch.compile全图模式添加Inductor物化启发式补丁
值得阅读其成本模型的设计思路(简洁有效),但注意该PR已被回滚。建议直接使用PyTorch 2.12(已包含上游官方修复),或等待vllm团队重新评估后修复已知问题并重新合入。
修复 ROCm 上 DeepSeek V4 功能与高并发精度问题
值得所有 ROCm + DeepSeek V4 用户关注。设计决策(AITER 回退、topk 统一入口)对类似平台适配有参考价值。建议阅读 `rocm_aiter_mla_sparse.py` 中的重构细节。
原始 PR · 作者 taneem-ibrahim · 合并时间 2026-05-17 22:40
PoolerClassify 去除全局状态依赖
值得精读。该 PR 展示了如何通过消除全局状态依赖来提升模块可测试性和可维护性,是良好的代码净化范例。设计决策清晰,测试验证充分。
修复 XPU FP8 weight_scale 张量形状
建议精读以了解 XPU FP8 后端的参数处理细节。应关注 review 中关于条件不一致的问题,并考虑在后续 PR 中修复:将 weight_scale 的转置放入与 weight 相同的 if 块中,确保两者布局始终同步。
原始 PR · 作者 zhenwei-intel · 合并时间 2026-05-17 12:15
XPU Worker 新增 V2 Model Runner 日志
值得合并。变更简洁、无风险,为 XPU 后端调试提供便利。可作为 V2 Model Runner 迁移状态的一个轻量级 markers。
Mamba SSM 缓存支持 bf16
该 PR 简单明确,建议合并。后续可考虑补充单元测试验证 `bfloat16` 选项在 Mamba 缓存中的实际可用性。
参与讨论