Prhub

vllm-project/vllm · 标签视图

标签列表

聚合结果

moe 相关 PR

2026-08-20
缺陷修复 重要性 6.90 洞察度 5.00

修复 DeepEP v2 下 TRTLLM BF16 的 top_k 错位崩溃

值得快速精读:核心修复只有一行,但它点出了一个重要的数据契约问题——同一 topk_ids 在不同调度路径(eager/cudagraph、DeepEP v2 expanded/普通展开)下形状语义不同,kernel 参数必须跟随实际数据布局而非模型配置。测试重构(`_make_experts` 参数化多后端)也值得借鉴,可作为 MoE kernel 测试的统一模式。

缺陷修复 重要性 5.29 洞察度 4.00

为 benchmark_moe.py 新增 Kimi K3 MoE 参数解析分支

值得快速阅读并纳入 benchmark 工具链。虽然改动很小,但展示了多模态模型 MoE config 解析的两个易踩坑点:参数嵌套在 `text_config` 中、top-k 字段命名差异(`num_experts_per_token` vs `num_experts_per_tok`)。建议后续为 `get_model_params()` 补充针对不同架构 config 的单元测试,固化字段名映射,防止未来架构新增时再次回退崩溃。

#48918 [CT] Support Humming for WNA16 MoE

原始 PR · 作者 yiliu30 · 合并时间 2026-08-20 00:31

功能 重要性 8.28 洞察度 6.00

为 CT WNA16 MoE 开启 Humming 后端,支持子字节位宽

值得精读。重点关注三类设计决策:用 Fraction + ceil 处理 sub-byte 打包维度、Humming 支持判定如何与权重 key 数据契约结合、以及 torch.dtype 与 ScalarType 统一字符串化的处理方式。同时值得学习 review 中从 mock 测试演进到 e2e 测试的过程。

缺陷修复 重要性 7.82 洞察度 6.00

修复 OCP MX MoE 模拟静默跳过 mxfp6 激活量化

值得精读。该 PR 是典型的“数据契约脱节”修复:上层映射表用了 dispatcher 不认识的键,导致功能静默失效。可借鉴两个设计决策:一是把映射提取为模块级纯函数以支持低成本单元测试;二是对未知 scheme 显式抛 NotImplementedError,让未来新增 scheme 立即暴露而非再次静默。建议同步查看 `moe_kernel_quantize_input` 的分发实现,理解键的契约来源。

缺陷修复 重要性 6.28 洞察度 5.00

修复 Triton 融合共享专家对齐计数,解决 MoE 精度崩溃

建议精读本 PR,它揭示了一个关键的数据契约细节:融合共享专家后,物理专家数可能与 global_num_experts 不一致。值得关注的设计决策是:在无 expert map 时使用实际权重行数,有 expert map 时保持原逻辑,这平衡了正确性与 EP 兼容性。同时,文档或注释可增强对专家计数语义的说明。

2026-08-19
基础设施 重要性 7.59 洞察度 6.00

扩展 ROCm 融合 MoE 与 FP8/FP4 测试,修复分布式失败传播。

值得精读,尤其是跨后端保留标量缩放 ABI 的设计(0-D 张量在 Triton 启动边界转指针)和分布式测试失败传播模式,对多平台 CI 测试框架设计有借鉴意义。

缺陷修复 重要性 4.90 洞察度 4.00

恢复 int8 分组 WNA16 MoE 支持

此 PR 值得精读,因为它涉及一个关键的回归修复,并揭示了重构中容易丢失的小修复。建议关注其缺失的测试覆盖,并考虑为类似场景添加回归测试。