Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-22 00:42 同步状态:空闲 下次计划:2026-08-22 01:42
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-03-23

#37877 [Bugfix][LoRA] Fix incorrect LoRA Log

原始 PR · 作者 jeejeelee · 合并时间 2026-03-23 19:42

缺陷修复 重要性 3.00 洞察度 3.00

修复 LoRA 日志输出中的模块列表错误。

变更简单,主要值得关注 review 讨论中的性能优化建议,可作为代码风格和性能考量的学习案例,无需深入阅读代码逻辑。

缺陷修复 重要性 5.00 洞察度 3.00

修复 CPU 后端在零化 KV 缓存块时因 Triton GPU 内核导致的崩溃。

建议工程师快速浏览此 PR,重点关注 CPU 后端如何处理 KV 缓存无效位置,以及如何避免 GPU 内核调用。对于涉及 Triton 与 CPU 集成的开发者,此 PR 展示了简单而有效的设计决策。

缺陷修复 重要性 5.00 洞察度 6.00

修复 responses API 中 arrival_time 记录错误,以准确测量 TTFT。

对于负责性能度量或 API 实现的工程师,建议精读此 PR 以理解 arrival_time 定义的重要性和当前修复。同时,关注 markmc 指出的其他问题,可能需要在后续 PR 中解决。

#32929 [FP8]add FP8 WoQ kernel abstraction.

原始 PR · 作者 jikunshang · 合并时间 2026-03-23 17:47

重构 重要性 6.00 洞察度 6.00

为FP8权重仅量化(WoQ)添加内核抽象,集成Marlin内核以支持无FP8硬件的GPU。

建议技术管理者和工程师精读此PR,重点关注内核抽象设计决策(如`init_fp8_linear_kernel`的集中化)和Marlin集成方式,这有助于理解vLLM量化栈的演进方向。同时,需注意review中未完全解决的风险点,如块量化兼容性问题。

#37863 [Misc]Update gitignore

原始 PR · 作者 wangxiyuan · 合并时间 2026-03-23 16:14

基础设施 重要性 1.00 洞察度 1.00

更新.gitignore忽略.python-version文件,避免贡献者本地环境冲突。

此PR变更琐碎,无需精读。对于新贡献者,可作为.gitignore配置的示例参考。

缺陷修复 重要性 5.00 洞察度 3.00

修复ROCm AITER ops中fused_moe_fake签名不匹配和其他错误,避免torch.compile崩溃。

这是一个关键bugfix,值得ROCm用户和涉及量化MoE或AITER ops的开发者快速review。建议关注签名匹配的一致性,并检查是否有其他类似签名不匹配问题在代码库中存在。

缺陷修复 重要性 6.00 洞察度 5.00

修复Qwen3.5模型中Triton autotuning缓存不匹配问题,消除推理时的autotuning延迟。

该PR值得精读,特别是对于关注Triton autotuning优化和dtype对齐的工程师。重点关注_warmup_prefill_kernels函数中的dtype匹配设计决策,以及如何通过测试验证性能改进,以应用于其他模型或内核优化场景。

参与讨论