修复混合精度类型下 AllReduce RMSNorm 量化融合导致输出损坏
值得精读,特别是对 vLLM 图融合模式注册机制感兴趣的开发者。展示了如何通过 `extra_check` 参数在模式匹配中增加细粒度约束,以及回归测试如何覆盖混合精度场景。
A high-throughput and memory-efficient inference and serving engine for LLMs
修复混合精度类型下 AllReduce RMSNorm 量化融合导致输出损坏
值得精读,特别是对 vLLM 图融合模式注册机制感兴趣的开发者。展示了如何通过 `extra_check` 参数在模式匹配中增加细粒度约束,以及回归测试如何覆盖混合精度场景。
为RLHF dev API路由添加/abort_requests端点
值得精读,特别是跨语言实现相同语义的设计(Python直接收集内部ID,Rust通过空向量表示中止所有)。注意Rust端跟踪时机窗口问题,未来需关注是否引入锁或调整注册时机。
将 MoE 通信从 all-reduce 替换为 reduce-scatter
建议合并(已合并)。该 PR 是一个典型的通信优化案例,值得关注其如何通过调整通信算子的时机和粒度来减少冗余数据移动。review 讨论中关于 padded reduce-scatter 的权衡也值得学习。
为推测解码添加运行时草稿权重更新
此 PR 实现了推测解码场景中缺失的 draft 权重运行时更新能力,设计上通过 `set_weight_update_target` 实现了 WeightTransferEngine 的目标切换,并妥善处理了 sleep/wake_up 参数保留问题。推荐精读 `gpu_worker.py` 中的 `_start_weight_update` 实现和 `base.py` 中的目标切换方法,它们是整个功能的骨架。同时关注与 #47357 的后续兼容调整。
支持混合模型细粒度前缀缓存命中
此 PR 设计精良,值得仔细阅读,特别是 `_mamba_block_aligned_split` 的分片逻辑和 CoW 两种路径。对于需要为自定义混合模型添加类似支持的工程师有很高参考价值。讨论中涉及的遗留问题(SWA、释放时机、拷贝顺序)需要在后续 PR 中跟踪。
原始 PR · 作者 zhejiangxiaomai · 合并时间 2026-07-12 12:30
CPU 后端 Qwen2.5-VL 多模态测试覆盖与 CI 整合
值得快速阅读,学习如何在多平台项目中利用 `current_platform` 条件化测试参数,以及如何设计 CI job 隔离以减少测试时间。核心逻辑变更不大,技术决策清晰。
原始 PR · 作者 AlejandroParedesLT · 合并时间 2026-07-12 08:13
修复 LoRA 设备识别缺失 ark_linear 分支
建议精读。此 PR 虽小但展示了清晰的问题定位与修复思路,是典型的条件分支遗漏修复案例。值得注意其测试策略:使用纯 mock(nn.Module + nn.Parameter)绕过硬件依赖,实现了可移植的单元测试。
调整 CI 并行度减少测试时间
该 PR 为纯粹的 CI 性能优化,无代码逻辑变更,值得合并。建议关注合并后 CI 实际耗时变化,可为进一步优化提供参考。
参与讨论