fused_moe_kernel 添加 swap AB 优化
该 PR 是值得精读的内核级优化,展示了如何通过调整矩阵乘法顺序利用 WGMMA 指令。建议关注 `enable_swap_ab` 的硬件条件,待 Blackwell 等新架构验证后应放宽限制。
A high-throughput and memory-efficient inference and serving engine for LLMs
fused_moe_kernel 添加 swap AB 优化
该 PR 是值得精读的内核级优化,展示了如何通过调整矩阵乘法顺序利用 WGMMA 指令。建议关注 `enable_swap_ab` 的硬件条件,待 Blackwell 等新架构验证后应放宽限制。
并行化 Mooncake KV 加载接收线程
该 PR 设计清晰,变更范围小,风险低,值得合并。建议读者关注:共享队列的设计如何实现负载均衡,以及完成结果汇聚的线程安全处理。对于部署 Mooncake 的用户,建议实测不同线程数下的性能差异。
Eagle3 新增 norm_output/fc_norm 配置传播
值得快速合并。逻辑简单、修复明确、关联 Issue 有完整背景和验证。
为 per_token_group_quant_8bit_kernel 启用 PDL
值得阅读,展示了现代 CUDA 中如何用 PDL 官方 API 替代 asm 实现 grid 同步,是 kernel 开发的良好实践。
将 seed_oss 解析器重构为 Qwen3Parser 子类,复用流式解析引擎
值得精读。PR 展示了如何通过继承和参数化重用 parser 引擎,是清理重复代码的优秀范例。
修复 MooncakeStore 抢占恢复后的块表错乱
该 PR 修复了一个隐蔽的同步缺陷,代码简洁且配合完善测试,建议精读 `build_connector_meta` 中 append/replace 分支的逻辑变更。
FlashInfer MXINT4 MoE 后端支持 gated SiLU 激活
**建议精读**(约 2 分钟)。该 PR 虽小但值得关注以下设计点:1) 如何通过 `_supports_activation` 等静态方法实现后端选择能力声明;2) 纯元数据修复与 kernel 无关的优化策略;3) 测试文件中针对静态方法的单元测试写法。
修复 Helion GPU 名称中的斜杠未归一化问题
该 PR 属于小范围 bugfix,变更简洁,测试覆盖了关键路径。建议快速合并。对于审核者,可关注正则表达式是否需引入 `regex` 库(与标准库 `re` 的差异)以及未来是否需支持更多 Unicode 分隔符。
参与讨论