Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-07-06
缺陷修复 重要性 8.74 洞察度 5.00

支持 Responses API namespace 工具名恢复

建议精读,特别是 vllm/tool_parsers/utils.py 中的映射函数设计。该 PR 解决了真实的客户端兼容性问题,设计上清晰地分离了内部展平名与外部原始名,是一个值得学习的前端协议适配案例。审核者 chaunceyjiang 的 review 提出了关键的代码组织建议,也值得关注。

#45243 [RISC-V] Enable BF16 on VLEN=256 hardware

原始 PR · 作者 velonica0 · 合并时间 2026-07-06 14:05

基础设施 重要性 5.08 洞察度 6.00

RISC-V BF16 强制启用与 VLEN=256 修复

建议精读 BF16Vec32 构造函数的改动,理解 RISC-V LMUL 扩展与元素复制的技巧。测试方面应增加 VLEN=256 硬件上的 BF16 算子单元测试,以及确保 VLEN=128 回归测试通过。

#46361 [INC][ARK] Direct Register Custom Op for ARK

原始 PR · 作者 Zhenzhong1 · 合并时间 2026-07-06 13:45

功能 重要性 8.88 洞察度 6.00

直接注册 ARK 自定义 Op 以支持 torch compile

- 建议量化相关开发者精读 inc_ark_ops.py,了解 direct_register_custom_op 和 fake impl 编写方式。 - 后续 CI 中增加 torch compile 模式的端到端测试覆盖 ARK 算子。 - 注册时机可考虑惰性化以提高鲁棒性,但对当前场景已足够。

#47687 [CI/Build][CPU] Remove global extra index

原始 PR · 作者 bigPYJ1151 · 合并时间 2026-07-06 13:42

基础设施 重要性 3.38 洞察度 2.00

移除 CPU 构建中全局 extra index 配置

建议合入。这是一个低风险的清理工作,提升了构建稳定性和可维护性。

缺陷修复 重要性 8.38 洞察度 6.00

修复 CPU INT4 MoE 的多项 bug 并恢复通道量化支持

本 PR 属于中等重要度的 Bugfix + 重构,对 Arm CPU 用户至关重要。建议阅读以下设计点: 1. **将硬件特有检查迁移到 `is_supported_config`**:这种模式保持了构造函数与平台无关,允许后端在配置阶段优雅降级。 2. **Fake 实现的注册方法**:对于 torch.compile 支持,查看 `vllm/_custom_ops.py` 中的 `register_fake` 用法。 3. **测试重构**:`convert_to_w4a8_int8_moe_format` 统一了权重打包逻辑,测试职责更清晰。 整体变更质量较高,审核中关键问题都已解决并获得 Approve。

测试 重要性 3.57 洞察度 2.00

限制 XPU 上 lmeval 测试 max-num-seqs

该 PR 价值较小,主要为解决特定硬件 CI 测试失败而设。无需精读,但体现了平台差异化的测试适配做法。

参与讨论