#43710 [DSv4] Refactor compressor & Fix ROCm compatibility
原始 PR · 作者 WoosukKwon · 合并时间 2026-05-27 10:56
重构 DeepSeek V4 compressor 并修复 ROCm 兼容性
建议合并。本次重构显著提升了代码可维护性,并修复了 ROCm 兼容性问题,是向跨平台支持迈出的重要一步。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 WoosukKwon · 合并时间 2026-05-27 10:56
重构 DeepSeek V4 compressor 并修复 ROCm 兼容性
建议合并。本次重构显著提升了代码可维护性,并修复了 ROCm 兼容性问题,是向跨平台支持迈出的重要一步。
原始 PR · 作者 yewentao256 · 合并时间 2026-05-27 10:56
移除已废弃的 cprofile 模块和 logit_bias/scale 配置
该 PR 是规范的废弃清理实践,适合作为参考案例:所有废弃项在发布前已提前标记,并附有迁移指南,最终按计划移除。团队成员可关注其文档更新的一致性检查,并注意 PR 作者在 review 过程中及时修复了 reviewer 指出的残留 deprecation note,体现了良好的协作。
原始 PR · 作者 MatthewBonanni · 合并时间 2026-05-27 10:56
新增 MLA prefill 后端可插拔注册机制
建议研究与 MLA 预填充后端开发的团队成员精读此 PR,特别是 `register_mla_prefill_backend` 的设计(装饰器+直接注册双模式)和 `CUSTOM` 占位符的处理方式。该设计是可扩展架构的良好范例。
原始 PR · 作者 LucasWilkinson · 合并时间 2026-05-27 10:55
统一 FlexAttention 与 FlashAttention 为 num-blocks 优先的 KV 缓存布局
此 PR 属于核心基础设施变更,建议所有关注注意力后端、KV 连接器和分布式推理的成员精读。其中跨后端布局统一的策略(标准化 shape + stride_order)具有设计参考价值。已知的 int32 overflow 问题需跟踪上游进度,并在 vLLM 侧准备 workaround。
FP8块缩放矩阵乘中占位张量优化,吞吐提升2%
值得合并的微小性能优化。设计思路(避免不必要的张量初始化)对其他类似占位符场景有参考价值。建议维护者关注后续是否会有子类误用`As`参数的风险,可考虑在`apply_block_scaled_mm`接口文档中强调`As`在未量化时可能为未初始化值。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-05-27 10:53
修复 ROCm 多模态模型编译与 Phi4MM 图片 mask 处理
值得精读:理解 ROCm 上绕过原生编译的技巧以及变长张量填充的通用模式(`stack_with_pad`)。关注 `get_act_and_mul_fn` 的设计扩展性。
为 Rust 聊天前端添加 HF 模板往返测试,并修复解析器和数值精度
该 PR 值得精读,特别是往返测试的设计模式和解析器重构手法。对于涉及工具调用和推理标签的模型集成,展示了如何构建端到端的测试验证。
原始 PR · 作者 lucianommartins · 合并时间 2026-05-27 08:11
修复 MTP 谱解码因 Q 头数不同导致的崩溃
此 PR 值得精读,因为它演示了一个典型的缺陷模式:数据契约(AttentionGroupKey)隐含的假设(所有层共享 num_heads_q)因谱解码场景而失效,导致部署崩溃。修复方式是在去重键中显式加入该维度,这是一个通用设计原则:分组/去重键应包含所有影响组内计算一致性的字段。另外,CI 依赖路径的补充也值得注意,它确保了 attention backend 的文件变更能触发相应的 spec decode 测试,弥补了测试覆盖缺口。
参与讨论