修复 DeepseekV2Model hidden_size 引用错误
值得合并,属于规范化修复,提升代码一致性和可维护性。建议后续考虑在相似模型中推广此模式。
A high-throughput and memory-efficient inference and serving engine for LLMs
修复 DeepseekV2Model hidden_size 引用错误
值得合并,属于规范化修复,提升代码一致性和可维护性。建议后续考虑在相似模型中推广此模式。
原始 PR · 作者 LopezCastroRoberto · 合并时间 2026-06-30 00:40
扩展 Triton kernel warmup 覆盖,支持 DSv4 稀疏 MLA 和 block table
值得精读。该 PR 展示了如何系统地为 Triton JIT kernel 添加启动预热,包含 backend 检测、参数空间枚举、条件过滤等模式。特别关注 `sparse_mla_triton_warmup.py` 中的 backend 识别和参数组合设计,以及审核中关于 MRv1/MRv2 差异的处理。可作为后续模型特定预热功能开发的参考。
FlashInfer升级0.6.13并启用持久缓存
建议仔细审阅`flashinfer_autotune`函数中DeepEP的判断逻辑,确认覆盖了所有相关的all2all后端。同时关注FlashInfer上游后续是否彻底解决持久缓存问题,届时可移除特判。GSM8K超时调整作为配套,无特别风险。
原始 PR · 作者 jasonlizhengjian · 合并时间 2026-06-30 00:29
添加 MiniMax-M3 NVFP4 量化支持
值得精读,特别是 Per-expert 参数 fallback 和注册的设计模式,以及混合精度配置中的 parent-prefix fallback 策略,可作为为特定模型添加量化支持的良好范例。
原始 PR · 作者 varun-sundar-rabindranath · 合并时间 2026-06-30 00:28
C扩展批量文件存在性检查,释放GIL提升KV offload查找性能
该PR适合关注KV offload性能的开发者精读,尤其学习C扩展与Python fallback结合的设计模式、`Py_BEGIN_ALLOW_THREADS`的使用场景。构建系统团队也可参考CMakeLists中扩展注册的方式。
修复 W8A8 int8 静态量化方案选择回归
建议立即合入。修复简洁明确,测试覆盖完整(含正向和反向验证),端到端验证通过。设计启示:量化方案路由条件应通过参数化测试严格覆盖,类似回归可通过条件分支变更规范化审查避免。
消除 LRUCacheLoRAModelManager 中 mypy 类型不兼容错误
值得合并。变更简洁、意图清晰,消除了 mypy 类型错误并清除了死代码。建议在合并前确认 CI 中 mypy 检查通过。
原始 PR · 作者 varun-sundar-rabindranath · 合并时间 2026-06-29 22:54
回退线程式 mmap pinning 以修复 CUDA Graph 挂起
该 PR 值得仔细阅读,因为它揭示了 CUDA Graph capture 与内存操作的严格同步要求。设计决策上,在正确性与微性能优化之间选择了正确性。建议关注后续是否会有更完善的异步方案加入。
参与讨论