RISC-V INT4 LUT 反量化 LMUL 压力降低 75%
该 PR 值得精读,展示了 RISC-V SIMD 优化中的 LMUL 寄存器压力权衡,是向量化编程中元素宽度选择的重要案例。
A high-throughput and memory-efficient inference and serving engine for LLMs
RISC-V INT4 LUT 反量化 LMUL 压力降低 75%
该 PR 值得精读,展示了 RISC-V SIMD 优化中的 LMUL 寄存器压力权衡,是向量化编程中元素宽度选择的重要案例。
修复 RISC-V VLEN 检测,恢复 RVV 注意力路径
值得合并。修复了明确的三个 bug,逻辑正确,已在目标硬件测试。建议后续补充测试用例以覆盖交叉编译和不同 VLEN 场景。
原始 PR · 作者 Zhenzhong1 · 合并时间 2026-07-06 13:45
直接注册 ARK 自定义 Op 以支持 torch compile
- 建议量化相关开发者精读 inc_ark_ops.py,了解 direct_register_custom_op 和 fake impl 编写方式。 - 后续 CI 中增加 torch compile 模式的端到端测试覆盖 ARK 算子。 - 注册时机可考虑惰性化以提高鲁棒性,但对当前场景已足够。
原始 PR · 作者 bigPYJ1151 · 合并时间 2026-07-06 13:42
移除 CPU 构建中全局 extra index 配置
建议合入。这是一个低风险的清理工作,提升了构建稳定性和可维护性。
修复 CPU INT4 MoE 的多项 bug 并恢复通道量化支持
本 PR 属于中等重要度的 Bugfix + 重构,对 Arm CPU 用户至关重要。建议阅读以下设计点: 1. **将硬件特有检查迁移到 `is_supported_config`**:这种模式保持了构造函数与平台无关,允许后端在配置阶段优雅降级。 2. **Fake 实现的注册方法**:对于 torch.compile 支持,查看 `vllm/_custom_ops.py` 中的 `register_fake` 用法。 3. **测试重构**:`convert_to_w4a8_int8_moe_format` 统一了权重打包逻辑,测试职责更清晰。 整体变更质量较高,审核中关键问题都已解决并获得 Approve。
限制 XPU 上 lmeval 测试 max-num-seqs
该 PR 价值较小,主要为解决特定硬件 CI 测试失败而设。无需精读,但体现了平台差异化的测试适配做法。
原始 PR · 作者 Liangliang-Ma · 合并时间 2026-07-06 11:32
XPU 跳过 fork 测试装饰器
该 PR 是简单的测试兼容性修复,逻辑清晰、风险极低,建议合入。适合作为学习 XPU 测试环境限制的参考。
原始 PR · 作者 chaojun-zhang · 合并时间 2026-07-06 11:29
使用 CPU 参考加速 Punica 测试 5.1×
值得精读,尤其是设计合理 CPU 参考并消除无用夹具以加速测试的方法。对于需要优化测试性能或规避特定平台算子 bug 的场景有参考价值。
参与讨论