修复 TRTLLM NVFP4 MoE 内核大批量 token 下的 CUDA grid 溢出
建议阅读 `trtllm_nvfp4_moe.py` 中的 chunking 实现,特别是 `_calc_max_supported_tokens` 的公式推导,它展示了如何根据 CUDA grid 限制逆向计算安全 token 数。此外,设计上选择仅在 TRTLLM NVFP4 内核启用 chunking 并在其他实现中移除未使用的 `supports_chunking`,体现了清晰的职责分离。此 PR 的测试方法也值得参考:通过对比极大数据配置下的运行和精度来验证修复。
参与讨论