修复测试依赖固定与 xgrammar 兼容性
建议技术管理者关注此 PR 采用的依赖管理策略:将公共依赖固定在 `common.txt` 中,各平台测试依赖通过 `-r` 引用并用 `pip-compile` 生成锁定文件。这种方法值得在项目其他部分推广。测试断言的语义化改进也值得参考。
A high-throughput and memory-efficient inference and serving engine for LLMs
修复测试依赖固定与 xgrammar 兼容性
建议技术管理者关注此 PR 采用的依赖管理策略:将公共依赖固定在 `common.txt` 中,各平台测试依赖通过 `-r` 引用并用 `pip-compile` 生成锁定文件。这种方法值得在项目其他部分推广。测试断言的语义化改进也值得参考。
原始 PR · 作者 izhuhaoran · 合并时间 2026-06-30 05:09
V2 Model Runner 支持 Mamba hybrid 模型 align 前缀缓存
本 PR 实现清晰,讨论深入,适合希望理解 Mamba 前缀缓存在 V2 中实现细节的工程师精读。特别是 copy-free vs pre-copy 的设计权衡以及 Triton kernel 的共享技术值得学习。
原始 PR · 作者 WoosukKwon · 合并时间 2026-06-30 04:24
FlashInfer MLA 支持返回 LSE,开启 DCP 功能
值得阅读,特别是关注 MLA attention backend 如何通过 attribute 和 condition 扩展功能。设计上使用 `can_return_lse_for_decode` 类属性和 `need_to_return_lse_for_decode` 实例属性分离能力声明与运行时决策,值得参考。建议配合 PR #47079 一起合入以修复 LSE log-base 问题。
XPU RMSNorm 回退 weightless 优化
建议精读了解 XPU 平台上的 kernel dispatch 优化策略。回退逻辑清晰,评审充分,可安全合入。
简化 R-SWA 批量数据传递方式
值得快速审阅和合并,属于代码质量提升的好实践。开发者可以学习到如何消除冗余缓冲区、简化数据流。
修复 DeepseekV2Model hidden_size 引用错误
值得合并,属于规范化修复,提升代码一致性和可维护性。建议后续考虑在相似模型中推广此模式。
原始 PR · 作者 LopezCastroRoberto · 合并时间 2026-06-30 00:40
扩展 Triton kernel warmup 覆盖,支持 DSv4 稀疏 MLA 和 block table
值得精读。该 PR 展示了如何系统地为 Triton JIT kernel 添加启动预热,包含 backend 检测、参数空间枚举、条件过滤等模式。特别关注 `sparse_mla_triton_warmup.py` 中的 backend 识别和参数组合设计,以及审核中关于 MRv1/MRv2 差异的处理。可作为后续模型特定预热功能开发的参考。
FlashInfer升级0.6.13并启用持久缓存
建议仔细审阅`flashinfer_autotune`函数中DeepEP的判断逻辑,确认覆盖了所有相关的all2all后端。同时关注FlashInfer上游后续是否彻底解决持久缓存问题,届时可移除特判。GSM8K超时调整作为配套,无特别风险。
参与讨论