#46148 [ROCm][CI] Only require q_scale==1.0 for fp8 query in RocmAttention
原始 PR · 作者 stefankoncarevic · 合并时间 2026-06-23 07:25
修复 ROCm 注意力层 q_scale 误报问题
值得合并,修复明确且影响范围有限。推荐关注后续注释精简的清理 PR。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 stefankoncarevic · 合并时间 2026-06-23 07:25
修复 ROCm 注意力层 q_scale 误报问题
值得合并,修复明确且影响范围有限。推荐关注后续注释精简的清理 PR。
原始 PR · 作者 fxmarty-amd · 合并时间 2026-06-23 07:19
为混合精度测试加上TP=4装饰器
PR 较为琐碎,仅作测试稳健性提升,不值得精读。值得注意的点是团队在review中推荐复用已有装饰器而非重复造轮子,体现了良好的代码复用习惯。
重构 Quark FP8 MoE 使用 oracle 后端并添加 Qwen3 评测
本 PR 是 vLLM 量化后端统一化的重要一步,反映了从手写分支到可扩展 oracle 模式的演进趋势。建议量化相关模块的维护者仔细阅读 `quark_moe.py` 的变更,理解后端选择流程。新增的评测配置也可作为 FP8 量化质量回归的参考。整体变更清晰,风险可控。
提前预留 TurboQuant workspace 防止 CUDA graph 锁定断言
此 PR 修复了一个影响 TurboQuant 用户的关键 bug,代码简洁且测试充分。建议阅读了解如何通过提前预留 workspace 解决 graph capture 后的动态分配问题。设计上保持了关注点分离(逻辑在 attention backend 内)。推荐合入。
原始 PR · 作者 ZewenShen-Cohere · 合并时间 2026-06-23 06:46
修复 static actorder 下 WNA16 MoE w2 scales sharding
值得精读的设计决策:将 sharding 规则提取为纯静态方法,方便单元测试和后续扩展;早失败原则(对不可整除 size 抛出异常)优于运行时 CUDA 崩溃。建议未来关注枚举替换字符串的后续 PR。
提升 ROCm CI 服务器启动超时至 1800 秒
简单配置调整,无精读必要。但可作为 ROCm CI 稳定性维护的参考,后续类似模型可参照此阈值。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-06-23 06:42
清理 ROCm CI 冗余测试组并优化硬件分配
该 PR 为常规基础设施清理,变更直接、风险低,值得快速合并。对于关注 ROCm CI 效率的团队,可以了解硬件分配策略。
原始 PR · 作者 tlrmchlsmth · 合并时间 2026-06-23 06:08
CPU 多模态测试增加第 4 个分片避免超时
该 PR 是典型的 CI 配置优化,逻辑简单且数据支撑充分,值得合并。建议后续关注是否有其他测试套件存在类似的分片不均衡问题。
参与讨论