优化 KV cache 释放策略,仅对缓存条目应用 LRU
值得精读,特别是 `free_blocks` 的设计决策——将分类逻辑下沉到基础设施,对调用方透明。是经典的缓存替换策略改进案例。
A high-throughput and memory-efficient inference and serving engine for LLMs
优化 KV cache 释放策略,仅对缓存条目应用 LRU
值得精读,特别是 `free_blocks` 的设计决策——将分类逻辑下沉到基础设施,对调用方透明。是经典的缓存替换策略改进案例。
支持 TRT-LLM MLA prefill 适配 GLM-5 维度
该 PR 是一项架构优雅的后端可扩展性改进,**值得精读**。重点关注: 1. `MLADimensions` dataclass 的引入如何取代布尔标志,使后端维度验证变得透明且可组合。 2. `validate_configuration` 从 `requires_r1_mla_dimensions and not is_r1_compatible` 变为白名单 membership 检查,这是“面向接口而非实现”的典型应用。 3. 文档生成工具用 AST 解析自动更新文档,保持代码与文档同步,值得其他模块效仿。 4. 未来新增 MLA 维度时,开发者只需在后端声明 `supported_mla_dimensions + MLADimensions(...)`,无需改动选择器或测试框架。
修复 Gemma4 required/named tool choice 误返回 JSON
建议阅读:展示了通过子类重写 adjust_request 优雅绕过基类 JSON 约束的通用模式,对其他模型解析器维护有参考价值。
原始 PR · 作者 divakar-amd · 合并时间 2026-06-17 04:31
修复 AMD CI 多模态测试误跑语言测试
建议精读该 PR 以了解 CI 配置修复方式。值得关注的设计决策:审核者指出这些命令在之前更新 AMD 定义时被忽略,说明 CI 配置维护需要更仔细的 review 流程。
新增 prefill step cadence 大幅提升 DP 场景 decode 延迟
值得精读,特别是 `schedule()` 中 defer 逻辑的实现和饱和保护机制。设计决策清晰,性能收益显著且经过充分基准测试。适合希望深入理解 v1 调度器及 DP 平衡策略的工程师。
更新 Mergify 工具调用标签规则
值得合并,属于低成本的流程改进,提高标签一致性。
原始 PR · 作者 hongxiayang · 合并时间 2026-06-17 02:50
MiniMax-M3 MXFP8 内核 tile 配置调优
值得精读,尤其关注 tile 选择函数的设计模式:在 compute kernel 中引入 regime-based tile 选择是一个通用的优化技巧。该 PR 代码简洁,思路清晰,适合作为 kernel 调优的参考。
融合多 KV-group 的 block table 分阶段写入为一个 Triton 内核
值得精读设计模式:如何将多个 `StagedWriteTensor` 的 staged writes 融合为一个内核,保持单组路径不变。但性能收益需在自有环境复现后再决定是否启用。建议增加更全面的压力测试和跨后端验证。
参与讨论