Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 18:31 同步状态:空闲 下次计划:2026-08-20 19:31

PR 列表

更多筛选
2026-07-11
缺陷修复 重要性 3.53 洞察度 2.00

修复 Qwen3.5-4B 模型注册缺失导致测试失败

小型测试修复 PR,无需精读。但值得关注的是 `_HfExamplesInfo` 的 `extras` 用法,它提供了一种在不改变默认示例模型的情况下注册额外模型的方式,可用于类似场景。

#47785 handle topk_ids padding in align sum kernel

原始 PR · 作者 gnovack · 合并时间 2026-07-11 04:33

缺陷修复 重要性 5.03 洞察度 3.00

修复 MoE align 内核中 topk_ids 的 -1 填充处理

此 PR 是对关键路径的鲁棒性修复,建议尽快合并。设计决策(将合法性检查封装为独立函数)值得借鉴,便于后续维护和扩展。

2026-07-10
功能 重要性 9.18 洞察度 6.00

AMD ROCm 启用 DeepSeek-V4 DSpark 推测解码

值得精读,特别是对跨平台模型移植和推测解码实现的工程师。重点关注 `model.py` 的 aux hidden state 收集设计和 `rocm.py` 的缓冲区修复策略。建议在合并后尽快补充 `amd/dspark.py` 的单元测试,并跟进 reviewer 对配置验证的质疑。

#47857 [Model] Add LongCat-Flash-Lite (n-gram embedding)

原始 PR · 作者 mgoin · 合并时间 2026-07-10 22:17

功能 重要性 9.18 洞察度 6.00

添加 LongCat-Flash-Lite n-gram 嵌入变体模型

该 PR 值得阅读,特别是 `ModelState` 隔离的架构模式、CUDA 自定义算子集成方式以及 fix 中的 guard 变量技巧。对于计划集成类似模型或需要理解 MRV2 的开发者有参考价值。

参与讨论