Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 18:31 同步状态:空闲 下次计划:2026-08-20 19:31

PR 列表

更多筛选
2026-07-25

#49729 [Model] Remove Plamo2

原始 PR · 作者 hmellor · 合并时间 2026-07-25 04:54

重构 重要性 8.35 洞察度 2.00

删除废弃的 Plamo2 模型

此 PR 是模型退役的标准操作,值得阅读以了解 _PREVIOUSLY_SUPPORTED_MODELS 的使用方法和完整的清理流程。不建议精读,但可作为代码清理的参考。

缺陷修复 重要性 7.26 洞察度 5.00

修复 KVBlockZeroer 对非均匀 KV 缓存页面大小的断言崩溃

强烈建议使用 GLM-5.2 或类似含多结构 KV 缓存组模型的用户升级到此提交。本 PR 展示了一个清晰的从假设到一般化的重构模式:将编译时常量改为运行时 per-segment 参数,避免核函数多实例化,值得在类似场景中复用。

缺陷修复 重要性 7.33 洞察度 7.00

修复 ROCm 上弹性 EP 缩放准确率并消除冗余重排通信开销

值得精读,尤其是 `rank_load_imbalance` 的 replica‑aware 不均衡度计算和 ROCm 平台专有条件的取舍。设计者对分布式数值一致性的强调和 review 中的集体决策讨论具有借鉴意义。

功能 重要性 8.04 洞察度 7.00

升级 NCCL 至 2.30.7 并添加 GIN 检测以启用 DeepEPv2

推荐精读:本 PR 展示了如何系统性地解决库版本依赖、硬件能力探测、容器构建优化和测试稳健性之间的耦合问题,尤其 `UV_OVERRIDE` 固定版本和 GIN 预检的设计值得借鉴。对于维护类似多阶段 Docker 构建或底层通信库升级的工程师有较高参考价值。

缺陷修复 重要性 5.74 洞察度 4.00

注册 axk1 模型配置,修复 A.X-K1 初始化失败

该 PR 值得精读,因为展示了如何在 vLLM 中注册新模型配置,以及处理模型类型大小写问题。可作为后续添加新模型的参考。

缺陷修复 重要性 7.37 洞察度 5.00

修复 GLM-4.1V 视频占位符 token ID 错误

建议精读核心改动,尤其是 `_call_hf_processor` 中的 token 映射逻辑和 `_get_video_frame_embed_token_id` 的抽取,这是管理 token ID 一致性的良好实践。

缺陷修复 重要性 5.71 洞察度 4.00

避免不必要的 Hugging Face 元数据网络请求

该 PR 值得合并,改动小而精确,针对具体的 CI 超时问题。可关注是否有类似的不必要 Hub 请求存在于其他模型加载路径中。建议在后续 PR 中考虑添加单元测试覆盖这些条件化路径。

参与讨论