#47316 [Misc] Use meta tensor for KV cache stride calculation
原始 PR · 作者 LucasWilkinson · 合并时间 2026-07-11 11:24
使用 meta tensor 计算 KV cache stride,避免无意义显存分配
该 PR 是典型的微小性能优化,代码简洁、风险低,值得快速合并。开发者可以学习使用 meta tensor 来避免不必要的张量分配。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 LucasWilkinson · 合并时间 2026-07-11 11:24
使用 meta tensor 计算 KV cache stride,避免无意义显存分配
该 PR 是典型的微小性能优化,代码简洁、风险低,值得快速合并。开发者可以学习使用 meta tensor 来避免不必要的张量分配。
原始 PR · 作者 LucasWilkinson · 合并时间 2026-07-11 11:22
修复 packed HND KV cache 形状重塑错误
值得合并,修复明确且风险低。建议补充针对 packed HND KV cache reshape 的单元测试,以覆盖该路径。
原始 PR · 作者 thisisjimmyfb · 合并时间 2026-07-11 10:05
降低 NVFP4 MoE 权重重排的峰值内存占用
建议精读。该 PR 展示了一个经典的用空间换时间到时间换空间的优化思路,review 中对正确性的深入讨论(原地操作的副作用)值得所有开发者注意。chunk swap 的实现也值得作为类似操作的参考。
FP4 MoE 重排峰值内存减半
该 PR 值得精读,展示了如何通过改变内存分配策略避免 Python list + torch.cat 的瞬时内存峰值,适用于其他类似场景。设计决策值得关注。
跳过 FlashInfer fp4_gemm 自动调优,减少 7 分钟启动时间。
建议精读,该 PR 展示了如何通过暴露调优控制来显著改善启动时间。`_flashinfer_autotune_skip_ops` 的自动检测逻辑值得参考。
修复自然思考结束后预算重入失效问题
建议阅读 `thinking_budget_state.py` 中 `_update_think_state` 的重写逻辑,理解 `scan_offset` 和早期检测的配合方式。测试代码 `TestThinkingBudgetNaturalEndReentry` 覆盖全面,可作为状态机边界测试的参考。
修复 Qwen3.5-4B 模型注册缺失导致测试失败
小型测试修复 PR,无需精读。但值得关注的是 `_HfExamplesInfo` 的 `extras` 用法,它提供了一种在不改变默认示例模型的情况下注册额外模型的方式,可用于类似场景。
修复 MoE align 内核中 topk_ids 的 -1 填充处理
此 PR 是对关键路径的鲁棒性修复,建议尽快合并。设计决策(将合法性检查封装为独立函数)值得借鉴,便于后续维护和扩展。
参与讨论