为推测解码添加运行时草稿权重更新
此 PR 实现了推测解码场景中缺失的 draft 权重运行时更新能力,设计上通过 `set_weight_update_target` 实现了 WeightTransferEngine 的目标切换,并妥善处理了 sleep/wake_up 参数保留问题。推荐精读 `gpu_worker.py` 中的 `_start_weight_update` 实现和 `base.py` 中的目标切换方法,它们是整个功能的骨架。同时关注与 #47357 的后续兼容调整。
A high-throughput and memory-efficient inference and serving engine for LLMs
为推测解码添加运行时草稿权重更新
此 PR 实现了推测解码场景中缺失的 draft 权重运行时更新能力,设计上通过 `set_weight_update_target` 实现了 WeightTransferEngine 的目标切换,并妥善处理了 sleep/wake_up 参数保留问题。推荐精读 `gpu_worker.py` 中的 `_start_weight_update` 实现和 `base.py` 中的目标切换方法,它们是整个功能的骨架。同时关注与 #47357 的后续兼容调整。
支持混合模型细粒度前缀缓存命中
此 PR 设计精良,值得仔细阅读,特别是 `_mamba_block_aligned_split` 的分片逻辑和 CoW 两种路径。对于需要为自定义混合模型添加类似支持的工程师有很高参考价值。讨论中涉及的遗留问题(SWA、释放时机、拷贝顺序)需要在后续 PR 中跟踪。
原始 PR · 作者 zhejiangxiaomai · 合并时间 2026-07-12 12:30
CPU 后端 Qwen2.5-VL 多模态测试覆盖与 CI 整合
值得快速阅读,学习如何在多平台项目中利用 `current_platform` 条件化测试参数,以及如何设计 CI job 隔离以减少测试时间。核心逻辑变更不大,技术决策清晰。
原始 PR · 作者 AlejandroParedesLT · 合并时间 2026-07-12 08:13
修复 LoRA 设备识别缺失 ark_linear 分支
建议精读。此 PR 虽小但展示了清晰的问题定位与修复思路,是典型的条件分支遗漏修复案例。值得注意其测试策略:使用纯 mock(nn.Module + nn.Parameter)绕过硬件依赖,实现了可移植的单元测试。
调整 CI 并行度减少测试时间
该 PR 为纯粹的 CI 性能优化,无代码逻辑变更,值得合并。建议关注合并后 CI 实际耗时变化,可为进一步优化提供参考。
原始 PR · 作者 ibondarenko1 · 合并时间 2026-07-11 23:52
修复MiMo-V2-Omni处理器SSRF漏洞,移除字符串输入支持
此 PR 值得关注,展示了安全补丁如何通过审查演进为架构清理。推荐学习其中的抽象边界讨论以及“最小权限”原则的应用。对于维护类似组件的团队,建议定期审查处理器是否承担了不应由它负责的输入解析。
修复媒体获取任务泄漏问题
建议阅读。这是一个典型的 asyncio 并发控制模式改进,对理解异步任务泄露和 asyncio.gather 的正确使用有学习价值。
原始 PR · 作者 LucasWilkinson · 合并时间 2026-07-11 23:11
将K/V打包到内容维度,统一KV缓存布局为4D
建议所有v1用户关注此PR,特别是在使用PD disagg的场景下。设计决策值得学习:通过统一布局后端接口,减少连接器耦合。合并前需确保AMD测试修复通过。
参与讨论