Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 20:44 同步状态:空闲 下次计划:2026-08-21 21:44

PR 列表

更多筛选
2026-07-27
基础设施 重要性 4.95 洞察度 2.00

Intel GPU CI 新增多组测试用例

本 PR 是典型的 CI 配置增强,逻辑简单直接,适合作为 Intel GPU CI 配置的参考基线。建议阅读以了解当前 Intel GPU 上的测试覆盖范围,但无需深入审查。

基础设施 重要性 3.73 洞察度 3.00

为 Kimi 和 K3 添加自动标签规则

该 PR 属于基础设施改进,逻辑清晰、验证充分,可直接合并。建议审阅者在合并后及时创建 `kimi` 和 `k3` 标签,并在 K3 启动阶段结束后按注释移除 `label-k3` 规则和相关标签。

功能 重要性 6.60 洞察度 4.00

暴露 stream_interval 作为请求级采样参数

此 PR 设计简洁,clamp 模式值得在其他请求级参数中借鉴。建议阅读 `vllm/v1/engine/output_processor.py` 中的 clamp 逻辑和测试用例,以理解安全边界的设计思路。

功能 重要性 5.40 洞察度 4.00

XPU 启用 QK Norm + RoPE 融合编译 pass

值得精读并合并。设计清晰且安全:将条件从 `is_cuda_alike` 扩展到 `is_cuda_alike or is_xpu`,同时将两个 pass 一起移入,保持了平台间的对称性。基准测试数据扎实,证明了性能收益和精度无损。

缺陷修复 重要性 4.82 洞察度 4.00

AMD CI 全局 GPU 内存清理改为 opt-in

建议 AMD CI 维护人员确认相关测试是否已正确设置 `VLLM_TEST_CLEAN_GPU_MEMORY=1`。此 PR 提供了合理的设计决策,值得阅读。

基础设施 重要性 5.47 洞察度 4.00

缩减 ROCm V1 attention 测试耗时

建议阅读,特别是 collection-time 参数验证的设计,可推广到其他需要根据运行时能力跳过测试的场景。

参与讨论