修复 Helion kernel 测试输入中 scale_ub 退化问题
建议合并。这是一次小但有意义的测试修复,消除了测试中的 false positive,使后续 Helion kernel 的测试更加可靠。
A high-throughput and memory-efficient inference and serving engine for LLMs
修复 Helion kernel 测试输入中 scale_ub 退化问题
建议合并。这是一次小但有意义的测试修复,消除了测试中的 false positive,使后续 Helion kernel 的测试更加可靠。
修复 Quark MXFP4 模型 MTP 加载时权重形状不匹配
建议合并,修复了明确的加载错误。设计简洁,逻辑集中在 should_ignore_layer 中。后续建议增加单元测试覆盖 check_children 分支,并考虑在 exclude 配置中支持正则以更通用地解决此类问题。
原始 PR · 作者 WoosukKwon · 合并时间 2026-07-17 02:26
为 Inkling 模型在 Hopper 上添加 FA4 score_mod 相对注意力路由
值得精读,尤其是 `_get_score_mod` 中通过 `cutlass.cute.jit` 在 score_mod 内实现相对偏置的设计模式,以及如何通过单一入口函数根据架构路由到不同 FA4 后端。这种模式可复用于其他模型的多架构适配。
原始 PR · 作者 yewentao256 · 合并时间 2026-07-17 02:22
将 flash_linear_attention 模块移至 third_party 目录
该 PR 是典型的模块级重构,设计决策简单,适合作为代码组织和依赖管理的参考案例。可关注 setup.py 中第三方包注册方式,为后续类似移动提供模板。
原始 PR · 作者 WoosukKwon · 合并时间 2026-07-17 01:28
为 Inkling 模型添加分段 CUDA 图支持
建议相关开发者详细阅读 `cudagraph_utils.py` 中 capture 逻辑的变化,理解 breakable 图与完整图在 metadata 管理上的差异。测试函数 `test_piecewise_capture_builds_fresh_metadata_for_both_passes` 展示了关键行为,值得学习。整体设计采用条件分支模式,可复用于未来其他需要 breakable CUDA 图的模型。由于改动涉及 CUDA 图管理核心,合并后建议密切监控相关模型(尤其是 Inkling)的性能和正确性。
原始 PR · 作者 Srinivasoo7 · 合并时间 2026-07-17 01:03
拆分层级查找延迟为同步/异步直方图
值得精读,尤其是同步/异步延迟拆分设计、观察时机的决策(allocation vs finish)如何与调度器生命周期对齐。团队其他成员可参考相同模式在其他模块应用。
原始 PR · 作者 music-dino · 合并时间 2026-07-17 00:47
延迟导入 aiter 避免 ROCm HIP 初始化导致 fork/spawn 问题
建议合并此 PR。它修复了明确的 bug,设计决策合理(延迟导入以避免副作用),且通过了 reviewer 的审核。值得其他可能需要避免启动时初始化 GPU 的模块借鉴。
原始 PR · 作者 AndyDai-nv · 合并时间 2026-07-16 22:47
修复 humming 量化跳过层的正则匹配 bug
建议合入。这是一个明确的 bug 修复,有充分的测试覆盖,并已获得批准。值得学习的是处理类似配置格式时的向后兼容性设计。
参与讨论