Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-22 00:42 同步状态:空闲 下次计划:2026-08-22 01:42

PR 列表

更多筛选
2026-05-27
性能优化 重要性 6.17 洞察度 5.00

避免 ROCm 编译时重复 bf16 转换

该 PR 改动小巧、聚焦,验证充分(性能、精度、FX dump),建议合并。值得注意的设计决策:通过额外 buffer 而非修改全局 dtype 来避免精度影响,以及将条件守卫精确限定在编译时快路径。

功能 重要性 8.60 洞察度 6.00

新增 MiniCPM5 XML 工具调用解析器

该 PR 设计清晰、测试全面,值得其他工具解析器实现参考。特别注意其流式参数增量构建方式(`_streaming_args_diff`)和 tokenizer 特殊字符归一化处理。建议阅读 `minicpm5xml_tool_parser.py` 中的注释理解关键决策。

缺陷修复 重要性 6.62 洞察度 5.00

修复 spec decode 下 KV connector 时序错误

建议所有使用 MRV2 + 推测解码 + KV 连接器的用户合入此 PR。设计上延迟 post_forward 到 proposer 之后是正确做法,值得作为模式参考。

性能优化 重要性 6.58 洞察度 5.00

暴露 AITER MoE 调度策略环境变量,支持 ROCm 性能调优

推荐合并。改动简洁、默认向后兼容,且提供了明确性能收益。建议后续引入自动化测试,并在文档中记录该环境变量。

缺陷修复 重要性 8.11 洞察度 5.00

为 Mooncake 实现 connector reset_cache,修复 RL 权重更新后外部缓存静默过时问题

值得精读,尤其关注 ZMQ admin 通道从隐式约定演进为命名标签协议的设计决策,以及 drain 发送队列 + remove_all 的竞态处理。建议在未来 PR 中强化 process_request 的输入验证和异常捕获,避免后台线程静默失效。

#43695 Fix test_aot_compile for torch 2.12

原始 PR · 作者 angelayi · 合并时间 2026-05-27 11:12

缺陷修复 重要性 4.06 洞察度 3.00

修复 PyTorch 2.12 下 AOT 编译测试失败

此 PR 是适配 PyTorch 2.12 的必要修复,变更简单直接,值得合并。建议后续统一检查其他使用 `VLLM_USE_MEGA_AOT_ARTIFACT` 的测试点,确保 torch 版本升级后的兼容性。

重构 重要性 8.45 洞察度 5.00

重构 DeepSeek V4 compressor 并修复 ROCm 兼容性

建议合并。本次重构显著提升了代码可维护性,并修复了 ROCm 兼容性问题,是向跨平台支持迈出的重要一步。

参与讨论