提前预留 TurboQuant workspace 防止 CUDA graph 锁定断言
此 PR 修复了一个影响 TurboQuant 用户的关键 bug,代码简洁且测试充分。建议阅读了解如何通过提前预留 workspace 解决 graph capture 后的动态分配问题。设计上保持了关注点分离(逻辑在 attention backend 内)。推荐合入。
A high-throughput and memory-efficient inference and serving engine for LLMs
提前预留 TurboQuant workspace 防止 CUDA graph 锁定断言
此 PR 修复了一个影响 TurboQuant 用户的关键 bug,代码简洁且测试充分。建议阅读了解如何通过提前预留 workspace 解决 graph capture 后的动态分配问题。设计上保持了关注点分离(逻辑在 attention backend 内)。推荐合入。
原始 PR · 作者 ZewenShen-Cohere · 合并时间 2026-06-23 06:46
修复 static actorder 下 WNA16 MoE w2 scales sharding
值得精读的设计决策:将 sharding 规则提取为纯静态方法,方便单元测试和后续扩展;早失败原则(对不可整除 size 抛出异常)优于运行时 CUDA 崩溃。建议未来关注枚举替换字符串的后续 PR。
提升 ROCm CI 服务器启动超时至 1800 秒
简单配置调整,无精读必要。但可作为 ROCm CI 稳定性维护的参考,后续类似模型可参照此阈值。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-06-23 06:42
清理 ROCm CI 冗余测试组并优化硬件分配
该 PR 为常规基础设施清理,变更直接、风险低,值得快速合并。对于关注 ROCm CI 效率的团队,可以了解硬件分配策略。
原始 PR · 作者 tlrmchlsmth · 合并时间 2026-06-23 06:08
CPU 多模态测试增加第 4 个分片避免超时
该 PR 是典型的 CI 配置优化,逻辑简单且数据支撑充分,值得合并。建议后续关注是否有其他测试套件存在类似的分片不均衡问题。
原始 PR · 作者 aarushjain29 · 合并时间 2026-06-23 06:05
限制 ROCm MLA 跨层 KV 缓存测试后端
该 PR 为简单的测试适配,值得快速合并。关注关联 issue #46411 以了解未来在其他 ROCm 后端的支持扩展。
为 DGX Spark 添加 GPQA 烟雾测试 CI 步骤
本 PR 属于常规 CI 基础设施扩展,无核心逻辑变更。值得关注的点: - DGX Spark(SM120)作为新硬件平台的支持入口。 - 镜像构建中 CUDA 架构列表的调整方法。 - 路径错误的修正应尽快合并以避免 CI 失败。 审阅者 @AndreasKaratzas 提出的配置复用建议可能驱动后续重构。
修复 FusedMoE 加载 shape-(1,) per-tensor scale 崩溃
值得精读:该 PR 虽然改动小,但展示了处理上下游数据格式不一致的典型模式:提取统一转换函数、扩展至所有潜在调用点、添加针对性的回归测试。设计决策如使用 `reshape(())` 而非 `squeeze()` 或 `view([])` 也体现了对维度安全的考虑(numel > 1 时失败)。推荐作为技术参考。
参与讨论