Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 18:24 同步状态:空闲 下次计划:2026-08-21 19:24

PR 列表

更多筛选
2026-06-12
重构 重要性 5.27 洞察度 3.00

移除 InternLMForCausalLM 注册别名

值得一读以了解 vLLM 模型别名弃用流程。展示了如何平衡向后兼容与清理遗留代码,包括使用 `_PREVIOUSLY_SUPPORTED_MODELS` 进行优雅降级。

缺陷修复 重要性 7.27 洞察度 5.00

修复Anthropic流式tool_use参数因分块丢失

该 PR 值得精读,尤其是对实现 API 流式转换的开发者。其核心设计决策是引入**缓冲 + 延迟刷出**机制,而不是在 stop_active_block() 内尝试区分参数与内容,保持了原有块停止逻辑的简洁。这种模式可以推广到类似需要暂存并发内容的场景。测试用例的构造也值得参考。

功能 重要性 8.26 洞察度 5.00

为 Rust 前端新增 continuous_usage_stats 流式选项

该 PR 清晰实现了所需功能,设计决策合理(去除 CLI 默认值、使用宏简化),测试覆盖充分。推荐合并,可作为 Rust 前端后续流式选项实现的参考模式。

缺陷修复 重要性 6.18 洞察度 6.00

修复 cuDNN FP8 ViT 注意力对 Blackwell 的误检

该 PR 是典型的边界条件修复,变更量小但诊断价值高,值得精读。它展示了如何通过逆向分析底层库(strings libcudnn)来定位根本原因的工程实践。对于维护多模态或 FP8 相关功能的工程师,应了解此门控逻辑,以及 cuDNN 内部多条 FP8 路径的差异。

2026-06-11
性能优化 重要性 8.36 洞察度 6.00

新增 per_token_group_fp8_quant Helion 核函数,性能提升 1.15-1.45x

该 PR 补充了一个重要的量化核函数,设计清晰、测试完善,建议所有使用 Helion 内核优化的开发者仔细阅读 `register.py` 中的 `mutates_args` 用法和 `pick_config` 选择策略。特别关注 review 中提出的 `use_ue8m0` 未调优风险以及测试环境覆盖度不足的问题,可在后续 PR 中提改进。

#41797 [Attention] add triton diff-kv backend for mimo

原始 PR · 作者 ZJY0516 · 合并时间 2026-06-11 23:36

功能 重要性 9.18 洞察度 6.00

新增 Triton DiffKV 注意力后端,支持 MiMo-V2.5 在 Blackwell 上运行

该 PR 对于需要在非 Hopper/特定 Blackwell GPU 上运行 MiMo 模型的用户至关重要。动态 backend 选择逻辑设计干净,值得借鉴。建议阅读内核实现以了解 DiffKV 场景下的 Triton 编程技巧。review 中提出的 dtype 限制和 batch invariant 问题需在后续 PR 中修复。

参与讨论