Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 14:34 同步状态:空闲 下次计划:2026-08-20 15:34
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-08-20

#48918 [CT] Support Humming for WNA16 MoE

原始 PR · 作者 yiliu30 · 合并时间 2026-08-20 00:31

功能 重要性 8.28 洞察度 6.00

为 CT WNA16 MoE 开启 Humming 后端,支持子字节位宽

值得精读。重点关注三类设计决策:用 Fraction + ceil 处理 sub-byte 打包维度、Humming 支持判定如何与权重 key 数据契约结合、以及 torch.dtype 与 ScalarType 统一字符串化的处理方式。同时值得学习 review 中从 mock 测试演进到 e2e 测试的过程。

缺陷修复 重要性 7.82 洞察度 6.00

修复 OCP MX MoE 模拟静默跳过 mxfp6 激活量化

值得精读。该 PR 是典型的“数据契约脱节”修复:上层映射表用了 dispatcher 不认识的键,导致功能静默失效。可借鉴两个设计决策:一是把映射提取为模块级纯函数以支持低成本单元测试;二是对未知 scheme 显式抛 NotImplementedError,让未来新增 scheme 立即暴露而非再次静默。建议同步查看 `moe_kernel_quantize_input` 的分发实现,理解键的契约来源。

缺陷修复 重要性 6.28 洞察度 5.00

修复 Triton 融合共享专家对齐计数,解决 MoE 精度崩溃

建议精读本 PR,它揭示了一个关键的数据契约细节:融合共享专家后,物理专家数可能与 global_num_experts 不一致。值得关注的设计决策是:在无 expert map 时使用实际权重行数,有 expert map 时保持原逻辑,这平衡了正确性与 EP 兼容性。同时,文档或注释可增强对专家计数语义的说明。

2026-08-19
缺陷修复 重要性 7.70 洞察度 5.00

修复非 AMX CPU 上 GDN conv 回退慢路径,启用 C++ 内核

值得精读。核心看点是“门控条件与内核真实指令依赖对齐”这一 bug 的定位方法:C++ 内核用 VDPBF16PS 而非 AMX tiles,却被 `is_amx` 挡在门外。配套的 float32 state、SD 布局、权重预打包三处同步放宽,展示了平台级功能开关需要端到端一致的典型模式;新增 fp32 oracle 测试的断言设计也值得借鉴。

功能 重要性 6.04 洞察度 5.00

ROCm Triton 量化路径新增 UE8M0 scale 打包支持

值得精读:一是“float32 中间计算 + 位运算打包 UE8M0”的两阶段思路,对理解 UE8M0 编码(float32 指数位提取、4 字节对齐、strided copy)很有价值;二是 Triton/C++ 双路径分叉的设备守卫模式,可作为平台差异化 kernel 实现的参考。对 ROCm/XPU 平台维护者尤其建议细看。评审中关于 `view` 保持维度与 `copy_` 非连续语义的交锋也值得留意,作者对 tensor 内存布局的理解是正确的。

基础设施 重要性 7.59 洞察度 6.00

扩展 ROCm 融合 MoE 与 FP8/FP4 测试,修复分布式失败传播。

值得精读,尤其是跨后端保留标量缩放 ABI 的设计(0-D 张量在 Triton 启动边界转指针)和分布式测试失败传播模式,对多平台 CI 测试框架设计有借鉴意义。

缺陷修复 重要性 4.90 洞察度 4.00

恢复 int8 分组 WNA16 MoE 支持

此 PR 值得精读,因为它涉及一个关键的回归修复,并揭示了重构中容易丢失的小修复。建议关注其缺失的测试覆盖,并考虑为类似场景添加回归测试。

#52801 [Build] Add InstantTensor to CUDA dependencies

原始 PR · 作者 mgoin · 合并时间 2026-08-19 22:55

基础设施 重要性 2.14 洞察度 2.00

为 CUDA 依赖新增 InstantTensor 包并更新锁文件

该 PR 属于常规依赖维护,值得快速了解,但不建议深入复习。值得关注的是其对未来 InstantTensor 加载器支持的前置意义,可留意后续是否会有相关功能 PR。同时,维护者应确保 InstantTensor 与现有 Torch 版本兼容,并在未来启用加载器时做好充分的测试。

参与讨论