Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15

PR 列表

更多筛选
2026-07-06

#46361 [INC][ARK] Direct Register Custom Op for ARK

原始 PR · 作者 Zhenzhong1 · 合并时间 2026-07-06 13:45

功能 重要性 8.88 洞察度 6.00

直接注册 ARK 自定义 Op 以支持 torch compile

- 建议量化相关开发者精读 inc_ark_ops.py,了解 direct_register_custom_op 和 fake impl 编写方式。 - 后续 CI 中增加 torch compile 模式的端到端测试覆盖 ARK 算子。 - 注册时机可考虑惰性化以提高鲁棒性,但对当前场景已足够。

#47687 [CI/Build][CPU] Remove global extra index

原始 PR · 作者 bigPYJ1151 · 合并时间 2026-07-06 13:42

基础设施 重要性 3.38 洞察度 2.00

移除 CPU 构建中全局 extra index 配置

建议合入。这是一个低风险的清理工作,提升了构建稳定性和可维护性。

缺陷修复 重要性 8.38 洞察度 6.00

修复 CPU INT4 MoE 的多项 bug 并恢复通道量化支持

本 PR 属于中等重要度的 Bugfix + 重构,对 Arm CPU 用户至关重要。建议阅读以下设计点: 1. **将硬件特有检查迁移到 `is_supported_config`**:这种模式保持了构造函数与平台无关,允许后端在配置阶段优雅降级。 2. **Fake 实现的注册方法**:对于 torch.compile 支持,查看 `vllm/_custom_ops.py` 中的 `register_fake` 用法。 3. **测试重构**:`convert_to_w4a8_int8_moe_format` 统一了权重打包逻辑,测试职责更清晰。 整体变更质量较高,审核中关键问题都已解决并获得 Approve。

测试 重要性 3.57 洞察度 2.00

限制 XPU 上 lmeval 测试 max-num-seqs

该 PR 价值较小,主要为解决特定硬件 CI 测试失败而设。无需精读,但体现了平台差异化的测试适配做法。

参与讨论