Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-07-14
功能 重要性 6.88 洞察度 5.00

支持 Intel XPU INT2 权重量化

值得关注的设计决策是 int2 强制依赖 ARK 而不提供 fallback,这简化了代码但限制了可移植性。评审中的模型规模和版本锁定讨论也具参考价值。建议阅读 `inc_wna16_scheme.py` 的条件逻辑和测试覆盖策略。

#48287 add pad-aware swiglu limit kernel

原始 PR · 作者 gnovack · 合并时间 2026-07-14 07:48

功能 重要性 8.19 洞察度 5.00

新增填充感知的 SwiGLU limit Triton 内核

此 PR 值得精读,特别是 Triton kernel 的设计模式(persistent row、列分块)以及如何通过 `topk_ids` 和 `expert_map` 实现填充感知。设计决策上将 pad-aware 功能无缝集成到现有接口中,保持向后兼容,是很好的工程实践。建议后续补充正式的单元测试。

#48463 [Feat] Add Support for BertForMaskedLM to vLLM

原始 PR · 作者 atalhens · 合并时间 2026-07-14 04:56

功能 重要性 8.18 洞察度 5.00

添加 BertForMaskedLM 模型支持

该 PR 实现清晰,适合作为新模型集成的模板。权重映射和命名处理的细节值得关注。建议阅读 bert.py 中的 BertForMaskedLM 类实现和对应的测试。

缺陷修复 重要性 5.08 洞察度 3.00

修复 Qwen3-VL MoE 缺少 model_config 属性

该 PR 虽然改动极小,但解决了编码器 CUDA Graph 场景下的崩溃问题,建议合并。值得关注的是一行修复背后涉及的继承设计问题:MoE 子类跳过了父类 init,未来若父类新增初始化逻辑,可能再次遗漏。

功能 重要性 8.51 洞察度 7.00

Mamba/SWA 共享前缀缓存保留优化

值得精读。PR 展示了如何在不改变上层接口的情况下,通过扩展内部数据结构(Request.shared_prefix_boundary)和统一分块停止条件,将 Marconi 缓存与稀疏 retention 策略优雅融合。`_mamba_block_aligned_split` 的重写是理解 vLLM 调度器核心逻辑的绝佳范例。建议关注 Mooncake 连接器的后续统一适配以及跨组共享前缀边界的精确性校验。

功能 重要性 5.94 洞察度 4.00

为 Qwen Eagle3 添加滑动窗口注意力支持

建议精读,这是一个清晰的特性扩展示例:通过配置驱动的 per-layer 滑动窗口支持,展示了如何在不破坏现有架构的前提下,为投机解码模型添加新能力。值得关注的是参数传递路径:从 Eagle3 特定层 → 通用 DecoderLayer → Attention 层。

参与讨论