修复 GPT-OSS 专家负载方法签名不匹配
建议合并。该 PR 修复了致命的启动崩溃,改动小而精确。值得关注的是 `expert_map` 参数改为从 `layer` 属性获取这一设计决策,减少了接口参数数量,提升了可维护性。
A high-throughput and memory-efficient inference and serving engine for LLMs
修复 GPT-OSS 专家负载方法签名不匹配
建议合并。该 PR 修复了致命的启动崩溃,改动小而精确。值得关注的是 `expert_map` 参数改为从 `layer` 属性获取这一设计决策,减少了接口参数数量,提升了可维护性。
修复 DP 测试因关机逻辑导致的延时问题
值得关注的设计点是“将单次阻塞操作拆解为并行阶段 + 统一等待”的模式,可复用于其他资源清理场景。同时建议后续跟进修复评论中提到的 baseline 选择小概率 bug。
原始 PR · 作者 gau-nernst · 合并时间 2026-04-30 07:16
用 `cvt` PTX 指令替换 Triton 实现,优化 FP4 量化并修正舍入错误
值得精读。该 PR 展示了如何利用硬件 PTX 指令简化数值密集操作并提升正确性,同时配套了严格的 bit-exact 测试确保替换的正确性。对于其他量化算子的优化有参考价值。
原始 PR · 作者 UranusSeven · 合并时间 2026-04-30 07:14
修复MLA索引器CUDA IMA崩溃
建议精读该PR以理解DP + CUDAGraph虚拟批次交互导致的边界条件问题,类似模式可能在其他注意力后端中出现。修复方案值得参考:当多个缓冲区大小依赖不同维度时,取最大值是简单有效的防御措施。
禁用 DeepSeek 注意力投影的动态 MXFP4 量化并启用 AITER 调优 BF16 GEMM
建议阅读 Review 中的讨论,特别是关于避免添加环境变量的决策过程和性能基准的论证。该 PR 展示了如何通过实测数据驱动默认值变更,并保持灵活性。ROCm 相关开发者可关注 `is_tgemm_enabled` 的实现,以便类似场景复用。
原始 PR · 作者 roikoren755 · 合并时间 2026-04-30 05:59
修复 CUDAGraph 捕获时 gc.collect 参数不匹配
建议立刻合入。该 PR 修复了一个明确的崩溃问题,修改极小且安全。对于使用嵌套 torch.compile 的模型(如 GB200 节点上的场景)至关重要。
原始 PR · 作者 puririshi98 · 合并时间 2026-04-30 05:56
新增 MNNVL AllToAll 分布式测试套件
对于关心分布式通信和 CI 基础设施的工程师,值得精读测试框架设计,尤其是多进程环境管理和错误传播模式。对于主要关注模型推理逻辑的开发者,可快速浏览了解覆盖范围即可。
两阶段暂停协议修复 DP 引擎死锁
值得精读的设计案例:如何在不增加同步开销的前提下利用现有 all-reduce 实现全局共识。建议关注两阶段协议的模式以及 `_pause_complete` 多态覆盖的设计。未来可考虑在 `pending_pause` 时触发即时 all-reduce 以降低暂停延迟。
参与讨论