#46756 Add MiniMax-M3 modelopt nvfp4 support
原始 PR · 作者 jasonlizhengjian · 合并时间 2026-06-30 00:29
添加 MiniMax-M3 NVFP4 量化支持
值得精读,特别是 Per-expert 参数 fallback 和注册的设计模式,以及混合精度配置中的 parent-prefix fallback 策略,可作为为特定模型添加量化支持的良好范例。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 jasonlizhengjian · 合并时间 2026-06-30 00:29
添加 MiniMax-M3 NVFP4 量化支持
值得精读,特别是 Per-expert 参数 fallback 和注册的设计模式,以及混合精度配置中的 parent-prefix fallback 策略,可作为为特定模型添加量化支持的良好范例。
原始 PR · 作者 varun-sundar-rabindranath · 合并时间 2026-06-30 00:28
C扩展批量文件存在性检查,释放GIL提升KV offload查找性能
该PR适合关注KV offload性能的开发者精读,尤其学习C扩展与Python fallback结合的设计模式、`Py_BEGIN_ALLOW_THREADS`的使用场景。构建系统团队也可参考CMakeLists中扩展注册的方式。
修复 W8A8 int8 静态量化方案选择回归
建议立即合入。修复简洁明确,测试覆盖完整(含正向和反向验证),端到端验证通过。设计启示:量化方案路由条件应通过参数化测试严格覆盖,类似回归可通过条件分支变更规范化审查避免。
消除 LRUCacheLoRAModelManager 中 mypy 类型不兼容错误
值得合并。变更简洁、意图清晰,消除了 mypy 类型错误并清除了死代码。建议在合并前确认 CI 中 mypy 检查通过。
原始 PR · 作者 varun-sundar-rabindranath · 合并时间 2026-06-29 22:54
回退线程式 mmap pinning 以修复 CUDA Graph 挂起
该 PR 值得仔细阅读,因为它揭示了 CUDA Graph capture 与内存操作的严格同步要求。设计决策上,在正确性与微性能优化之间选择了正确性。建议关注后续是否会有更完善的异步方案加入。
原始 PR · 作者 NickLucche · 合并时间 2026-06-29 22:54
Triton MLA attn logits 预分配,性能提升 ~35%
该 PR 是典型性能优化案例,值得精读。其设计模式(预分配 workspace 避免每步分配、提取 shared 计算函数防止漂移)清晰易懂,可为其他类似优化借鉴。
原始 PR · 作者 xiaohongchen1991 · 合并时间 2026-06-29 22:54
添加 Helion fused_qk_norm_rope kernel,H100 加速 1.38x
值得精读的设计点:1. `pick_config` 的最近匹配策略(按 q_heads 差距最小优先,再按 kv_heads、num_tokens 等)可作为类似场景的参考。2. 使用 `@default_vllm_config` 装饰器和 `FakeTensorMode` 在测试中规避设备限制是良好的测试实践。3. 从 C++ op 回退到原生 PyTorch 作为 baseline 展示了在依赖不稳定时的稳健选择。4. 配置文件的 JSON 结构(key + config)为 Helion autotuning 提供了标准接口。
修复 deepseek_v2 最终层 aux hidden 状态缺失
建议合并。该 PR 修复了 deepseek_v2 模型在 aux hidden state 捕获上的关键 bug,代码改动精确(3 行),无副作用。建议在后续迭代中增加自动化测试,覆盖 end_layer 配置场景,防止回归。review 中的 all-gather 讨论值得关注,可作为上下文并行下 aux hidden state 处理的设计参考。
参与讨论