移除已废弃的 Tarsier 和 Tarsier2 模型
此 PR 属于技术债务清理,不包含复杂设计决策。但因其涉及多文件联动修改(模型、配置、注册表、示例、测试、文档),可作为 vLLM 模型弃用流程的参考样例,值得相关维护者阅读。
A high-throughput and memory-efficient inference and serving engine for LLMs
移除已废弃的 Tarsier 和 Tarsier2 模型
此 PR 属于技术债务清理,不包含复杂设计决策。但因其涉及多文件联动修改(模型、配置、注册表、示例、测试、文档),可作为 vLLM 模型弃用流程的参考样例,值得相关维护者阅读。
原始 PR · 作者 peizhang56 · 合并时间 2026-06-30 20:31
修复AITER MLA FP8 decode元数据类型缺失导致精度退化
值得所有关注 ROCm 和 MLA 后端的工程师精读。本 PR 展示了如何通过参数传递的细微差异导致静默错误,并通过精巧的回归测试(spy + golden 对比)来防护。设计决策明确:优先根因修复而非 workaround。
原始 PR · 作者 dependabot[bot] · 合并时间 2026-06-30 20:16
升级 actions/checkout 从 v6.0.1 到 v7.0.0
该 PR 是常规的 Dependabot 自动依赖升级,技术含量低,无精读价值。但值得关注的是 `actions/checkout` v7.0.0 的破坏性变更说明(特别是 `pull_request_target` 安全限制),如果未来团队在 CI 中涉及类似场景,需要调整工作流配置。
更新 long_prefill_token_threshold 文档说明 0 禁用
这是一个小型文档改进 PR,适合快速回顾了解配置验证模式和文档最佳实践。建议阅读关联 issue #43985 和类似 PR #43794 以了解 vLLM 配置验证的整体模式。
原始 PR · 作者 chaojun-zhang · 合并时间 2026-06-30 19:20
启用 XPU 上 sharded state loader 测试
建议合入。该 PR 改动简洁、目的明确,通过极小的测试参数调整和 CI 配置新增,填补了 XPU 平台在分布式模型加载测试上的空白。值得关注的是其设计模式——复用已有的 `max_num_seqs=1` 策略来应对显存受限平台,而非引入全新逻辑,体现了可维护性。
新增 Tencent HPC-Ops 注意力后端,支持 FP8 融合算子
值得精读。该 PR 展示了如何将外部高性能算子库集成到 vLLM 的注意力后端框架中,包括自定义 op 注册、元数据构建、torch.compile 兼容性处理等模式。建议关注:HpcRopeNorm 的 CustomOp 设计、HpcAttnMetadata 与通用 metadata 的协作、以及 model_loader/utils.py 中的通用扩展点。
为XPU放宽Mamba SSM测试精度阈值
本PR是常规的测试适配变更,改动小且经过review确认,建议快速合并。值得关注的是使用`current_platform`统一平台检查的实践,可在其他测试中推广。
原始 PR · 作者 jperezdealgaba · 合并时间 2026-06-30 17:39
添加图像像素限制防止解压炸弹 OOM
值得精读。设计上在加载前预检、环境变量控制、避免全局状态突变,是良好的安全实践,可推广到其他媒体类型。
参与讨论