Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 18:31 同步状态:空闲 下次计划:2026-08-20 19:31

PR 列表

更多筛选
2026-05-05

升级 xgrammar 至 0.2.0,利用内置 structural tags 增强工具调用。

值得精读,尤其是 `structural_tag_registry.py` 中的装饰器注册模式和 `adjust_request` 的优先级设计。环境变量门控策略是降低风险的良好实践。建议关注后续的增量模型支持和 Qwen3Coder `supports_required_and_named` 的修复 PR。

缺陷修复 重要性 6.48 洞察度 6.00

修复 chunked prefill 请求驱逐时 prompt logprobs 丢失

值得精读这个小巧但关键的数据流修复。它展示了将临时状态与请求生命周期绑定的设计模式,并体现了如何通过边界调整和状态归属重构解决并发下的数据一致性问题。团队在类似 feature(如 speculative decoding 状态)的维护时可参考此模式。

#41205 Fix Nano Nemotron text-only weight loading

原始 PR · 作者 Baekpica · 合并时间 2026-05-05 02:43

缺陷修复 重要性 7.78 洞察度 5.00

修复Nano Nemotron VL文本模式下多模态权重加载

该PR设计清晰,通过复用`multimodal_config`接口统一判断文本仅模式,避免了引入额外配置字段。新增测试覆盖全面,值得精读。建议关注类似多模态模型(如Qwen-VL)的文本仅模式实现,可复用此模式。

缺陷修复 重要性 3.80 洞察度 4.00

升级 ROCm 至 7.2.2,重建 CLR 修补 profiler

建议在后续 PR 中验证 hotfix 的安装路径,补充 `-DCMAKE_INSTALL_PREFIX`;执行 `apt-get clean` 或清理 list 缓存以优化镜像层;在升级到 ROCm 7.2.3 时及时移除临时 hotfix。此 PR 的稀疏检出 + 固定 commit 模式值得借鉴,适合用于上游修复未发布时的临时工单。

2026-05-04
测试 重要性 5.29 洞察度 4.00

分离 Nemotron nano-v2/v3 测试,禁用冗余测试

该 PR 虽然只修改了测试配置,但体现了测试策略的微调:将不同变体映射到各自模型以触发差异特性。值得关注的决策点是移除 V2 的 `vision_config` override,未来若出现 OOM 问题可快速恢复。建议 CI 运行后观察 V2 测试是否稳定。

参与讨论