#46346 [GDN] Improve kkt kernel of CuteDSL prefill backend
原始 PR · 作者 gau-nernst · 合并时间 2026-06-30 09:34
优化 CuteDSL KKT 内核,融合逆与后处理
值得精读,尤其是对 Blackwell GPU 上 CuteDSL 内核开发感兴趣的工程师。该 PR 展示了性能 profiling 驱动的优化方法,和计算融合、warp 级流水解耦的设计模式。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 gau-nernst · 合并时间 2026-06-30 09:34
优化 CuteDSL KKT 内核,融合逆与后处理
值得精读,尤其是对 Blackwell GPU 上 CuteDSL 内核开发感兴趣的工程师。该 PR 展示了性能 profiling 驱动的优化方法,和计算融合、warp 级流水解耦的设计模式。
修复 thinking_token_budget 在强制结束后的重入问题
值得精读:该 PR 展示了状态机重入问题的典型修复方法,通过引入扫描偏移和状态重置精确控制重入检测。实现简洁但有效,设计决策清晰,代码注释详尽。建议关注 reasoning 相关功能的团队仔细审查并学习。
MultiConnector 合并 kv_transfer_params 字典
值得精读,改动简洁清晰,展示了接口兼容的设计权衡。
原始 PR · 作者 yewentao256 · 合并时间 2026-06-30 06:45
修复 GLM5.2 非 torch.compile 路径 sparse attention 内存分配问题
该 PR 是典型的细小但关键的控制流修复,变更仅 4 行。对于维护 deepseek_v32 注意力模块的开发者可以快速理解,对于普通使用者无需深入。建议部署 GLM5.2 的用户及时合入此修改。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-06-30 05:34
ROCm CI OTLP 测试改用 spawn 并清理资源
推荐阅读该 PR,它展示了如何处理 fork 与 gRPC 线程冲突的典型方法:通过检测平台切换到 spawn 模式,并注重资源释放。对于在其他平台需类似调整的场景有参考价值。
原始 PR · 作者 peizhang56 · 合并时间 2026-06-30 05:29
修复 ROCm CI 缺少 cohere_melody 依赖
建议合并无风险变更。可提醒团队将新依赖同步添加至其他平台(如 Intel GPU)的 requirements.in 文件,若其也运行相同测试。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-06-30 05:28
修复ROCm DeepEP高吞吐DBO精度问题
建议精读,尤其是`_sync_dbo_comm_if_needed`的设计模式与CU分区禁用的权衡。该PR展示了在GPU通信与计算重叠场景下,如何通过细粒度同步解决竞态条件,对类似异构并行模式的开发者有参考价值。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-06-30 05:26
修复 ROCm 内存采样竞态条件
值得阅读,展示了如何优雅处理平台特定的时序问题,为其他后端类似问题提供参考。
参与讨论