#47521 [Quantization][INC][ARK] Support INT2 XPU WOQ Linear
原始 PR · 作者 Zhenzhong1 · 合并时间 2026-07-14 08:29
支持 Intel XPU INT2 权重量化
值得关注的设计决策是 int2 强制依赖 ARK 而不提供 fallback,这简化了代码但限制了可移植性。评审中的模型规模和版本锁定讨论也具参考价值。建议阅读 `inc_wna16_scheme.py` 的条件逻辑和测试覆盖策略。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 Zhenzhong1 · 合并时间 2026-07-14 08:29
支持 Intel XPU INT2 权重量化
值得关注的设计决策是 int2 强制依赖 ARK 而不提供 fallback,这简化了代码但限制了可移植性。评审中的模型规模和版本锁定讨论也具参考价值。建议阅读 `inc_wna16_scheme.py` 的条件逻辑和测试覆盖策略。
新增填充感知的 SwiGLU limit Triton 内核
此 PR 值得精读,特别是 Triton kernel 的设计模式(persistent row、列分块)以及如何通过 `topk_ids` 和 `expert_map` 实现填充感知。设计决策上将 pad-aware 功能无缝集成到现有接口中,保持向后兼容,是很好的工程实践。建议后续补充正式的单元测试。
原始 PR · 作者 emricksini-h · 合并时间 2026-07-14 07:25
修复 Dynamo OTEL span 起始时间错误
PR 修复逻辑正确,改动简洁,已获 reviewer 确认和独立复现。建议合并。
原始 PR · 作者 langzhao-netizen · 合并时间 2026-07-14 05:40
在 OpenAI 端点暴露 logprob_token_ids 支持
值得精读,尤其是协议层字段添加、验证器编写和采样参数传递的模式。这是 vLLM 前端扩展规范化的良好示例。
添加 BertForMaskedLM 模型支持
该 PR 实现清晰,适合作为新模型集成的模板。权重映射和命名处理的细节值得关注。建议阅读 bert.py 中的 BertForMaskedLM 类实现和对应的测试。
原始 PR · 作者 wenpengw-nv · 合并时间 2026-07-14 04:43
修复 Qwen3-VL MoE 缺少 model_config 属性
该 PR 虽然改动极小,但解决了编码器 CUDA Graph 场景下的崩溃问题,建议合并。值得关注的是一行修复背后涉及的继承设计问题:MoE 子类跳过了父类 init,未来若父类新增初始化逻辑,可能再次遗漏。
Mamba/SWA 共享前缀缓存保留优化
值得精读。PR 展示了如何在不改变上层接口的情况下,通过扩展内部数据结构(Request.shared_prefix_boundary)和统一分块停止条件,将 Marconi 缓存与稀疏 retention 策略优雅融合。`_mamba_block_aligned_split` 的重写是理解 vLLM 调度器核心逻辑的绝佳范例。建议关注 Mooncake 连接器的后续统一适配以及跨组共享前缀边界的精确性校验。
为 Qwen Eagle3 添加滑动窗口注意力支持
建议精读,这是一个清晰的特性扩展示例:通过配置驱动的 per-layer 滑动窗口支持,展示了如何在不破坏现有架构的前提下,为投机解码模型添加新能力。值得关注的是参数传递路径:从 Eagle3 特定层 → 通用 DecoderLayer → Attention 层。
参与讨论