利用 HF no-exist 缓存避免重复下载
值得快速合并的小优化改进。建议了解 `huggingface_hub` 的 no-exist 缓存机制,后续类似场景可参考此模式。
A high-throughput and memory-efficient inference and serving engine for LLMs
利用 HF no-exist 缓存避免重复下载
值得快速合并的小优化改进。建议了解 `huggingface_hub` 的 no-exist 缓存机制,后续类似场景可参考此模式。
修复 MRV2 跨注意力块表大小不足问题
该 PR 变更简单但至关重要,建议所有使用 MRV2 且涉及编码器-解码器模型的用户合入。值得关注的是 `scheduler_config.max_num_encoder_input_tokens` 作为新数据源的使用,体现了 V2 架构对调度器配置的依赖。
提取 ModelState 基类初始化逻辑,消除三个子类的重复代码
此 PR 是教科书级的"消除重复代码"重构,适合作为团队内部 code review 和重构实践的参考。虽然没有功能变更,但通过将公共初始化提升到基类,减少了约70行代码,并明确了 `ModelState` 子类的职责边界。值得 MRv2 相关开发者精读以了解子类层次结构。
修复 Transformers 后端 FP8 MoE 的内存泄漏并清理样板代码
此 PR 值得仔细阅读,展示了如何通过集中化 EPLB 状态管理和清理样板代码来减少跨模型冗余。关注 MoE 架构的开发者应重点审查 transformers/moe.py 和 interfaces.py 的接口变化,确认与自定义模型的兼容性。
修复 ROCm MLA 预填充崩溃,传入 num_kv_splits 参数
该 PR 是应对上游 AITER 接口变更的适配修复,变更极小(+3 行注释 +1 行逻辑),但修复了一个阻断性 bug,值得立即合并和回传。建议回顾者重点关注参数位置是否正确,以及是否有其他未覆盖的 `mla_reduce_v1` 调用点。
为 KV-cache 相关模块添加 codeowner
无需精读,属于标准的人员权限配置变更。
为 HarmonyParser 添加 flush() 方法,调用 process_eos() 刷新并重置。
此 PR 值得技术负责人和 parser 模块维护者精读,特别是 `flush()` 中异常处理和惰性初始化的设计决策。它展示了如何在不破坏现有接口的前提下,为下游修复铺平道路。后续 PR #46102 将进一步完善 serving 层集成,建议关注。
移除混合模型 FA 块大小限制
建议精读。该 PR 虽然改动小(仅 17 行删除),但涉及混合模型注意力机制的核心限制移除,是清理历史技术债务的好例子。推荐关注:1) 如何通过系统性的修复(KVBlockZeroer)替代临时 workaround;2) 对 hetero TP PD disagg 场景的潜在影响需在后续测试中确认。
参与讨论