Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 19:35 同步状态:空闲 下次计划:2026-08-21 20:35

PR 列表

更多筛选
2026-06-26
功能 重要性 8.64 洞察度 7.00

为 render 端点添加可选 token offsets

值得精读。该 PR 设计严谨(显式能力模型、静态判断优先)、讨论深刻(测试策略、统一调用路径),并明确文档化已知局限。适合作为前端 API 演进的样板 PR。

缺陷修复 重要性 5.68 洞察度 4.00

修复 AITER 升级后 unified attention 分发断言失败

值得精读,特别是对 ROCm 注意力后端的选择和测试模式感兴趣的同学。该 PR 体现了升级上游依赖(AITER)后如何快速定位并修复兼容性问题,以及如何通过声明式约束和测试调整来保证正确性。此外,AMD CI 构建步骤硬失败的配置变更也值得关注。

重构 重要性 5.43 洞察度 2.00

将遗留 API server 移至 examples 目录

该 PR 属于代码组织清理,值得精读以了解项目结构演进。更推荐关注后续是否会在 examples 中进一步维护或废弃该遗留 server。

缺陷修复 重要性 7.34 洞察度 5.00

修复 PoolsideV1 工具解析器的空白处理和工具选择冲突

值得精读——该 PR 展示了在工具解析器中处理两种不同 API 协议下的工具形状差异(嵌套 vs 扁平)的兼容模式,以及如何通过 early return 避免 JSON 引导与原生模板的冲突。测试设计也值得参考(分别覆盖 ChatCompletion 和 Responses 的 required/named 路径)。建议关注 #39870 类似的跨 API 兼容性修复模式,并留意未来迁移到统一 parser engine 的演进方向。

#46706 Remove grok model arch from vllm

原始 PR · 作者 xianbaoqian · 合并时间 2026-06-26 14:02

重构 重要性 9.00 洞察度 4.00

删除 Grok 模型架构及全部配套代码

该 PR 是一个典型的移除过时功能的清理操作,展示了如何系统性地删除一个模型架构及其配套组件。对于仓库维护者,建议关注类似的低使用率模块清理。对于其他开发者,可学习此类 PR 的完整覆盖模式(核心实现、tokenizer、renderer、注册表、配置、测试、文档)。

参与讨论