#37512 MiniMax-M2: add Eagle3 speculative decoding support
原始 PR · 作者 liuchenbing2026 · 合并时间 2026-04-06 10:50
为MiniMax-M2模型添加Eagle3推测解码支持,扩展模型功能。
建议技术管理者和工程师精读此PR,重点关注如何通过EagleModelMixin标准化集成推测解码支持的设计模式,以及从注册表错误中学习代码审查的重要性,这些对类似模型扩展有借鉴价值。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 liuchenbing2026 · 合并时间 2026-04-06 10:50
为MiniMax-M2模型添加Eagle3推测解码支持,扩展模型功能。
建议技术管理者和工程师精读此PR,重点关注如何通过EagleModelMixin标准化集成推测解码支持的设计模式,以及从注册表错误中学习代码审查的重要性,这些对类似模型扩展有借鉴价值。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-04-06 09:42
为ROCm平台Triton内核添加非对称INT8量化支持,解锁非对称INT8模型运行。
建议精读vllm/model_executor/kernels/linear/scaled_mm/triton.py文件,关注非对称量化处理逻辑和与Cutlass内核的对齐设计;对于ROCm平台开发者,此PR提供了关键量化支持,值得参考实现细节。
在MI325上启用内核核心测试,并跳过MI250上因量化精度导致的flaky测试。
建议关注此PR中处理硬件特定flakiness的策略,以及测试覆盖率的权衡。对于涉及跨平台测试的团队,可借鉴条件性跳过测试的方法,但需确保核心逻辑不受影响,并考虑长期维护成本。
原始 PR · 作者 netanel-haber · 合并时间 2026-04-06 06:23
修复nano_nemotron_vl模型视频分析时张量设备不匹配异常。
该PR变更简单直接,无需精读。对于维护nano_nemotron_vl模型或处理设备同步问题的工程师,可以关注_create_final_video_embeddings方法中设备显式传递的模式,作为避免类似设备不匹配问题的参考。
将25个通过验证的CI测试步骤切换到H200 MIG 18GB设备队列。
建议 CI/基础设施维护者审阅此 PR,以了解测试资源分配策略更新和依赖的外部变更;对于一般开发者,无需深入阅读代码,但可关注 CI 环境变化可能带来的测试执行时间或资源占用差异。
原始 PR · 作者 Gregory-Pereira · 合并时间 2026-04-06 03:11
修复cudagraph_mm_encoder启用时因模块导入路径错误导致的ModuleNotFoundError。
该PR值得快速浏览以了解cudagraph_mm_encoder功能的基础架构。重点关注: 1. encoder_cudagraph相关模块的组织结构。 2. Qwen3-VL模型如何实现SupportsEncoderCudaGraph协议。 3. 导入路径一致性在大型项目中的重要性。
原始 PR · 作者 Gregory-Pereira · 合并时间 2026-04-06 01:11
修复Gemma 4流式工具调用中因部分分隔符泄漏导致的JSON解析错误。
该PR值得快速浏览,重点关注`_emit_argument_diff`方法中剥离字符集的扩展逻辑,这是修复的核心;同时可学习如何通过单元测试模拟流式边界情况。对于涉及工具调用或流式处理的开发者,此变更展示了处理部分令牌问题的典型模式。
优化Trtllm fp8 MoE权重布局为Shuffled Weights和BlockMajorK,提升性能。
建议精读此PR,重点关注权重布局优化设计(如BlockMajorK布局选择)和对warmup逻辑的修复,这对理解vLLM中MoE性能调优和兼容性处理有参考价值。
参与讨论