为 AMD CI 添加软失败配置
该 PR 价值较低,主要解决 CI 稳定性问题。如果关注 CI 配置或 AMD 平台状态,可以了解;否则无需深入。建议在 Torch 升级后及时移除 `soft_fail` 并修复底层问题。
A high-throughput and memory-efficient inference and serving engine for LLMs
为 AMD CI 添加软失败配置
该 PR 价值较低,主要解决 CI 稳定性问题。如果关注 CI 配置或 AMD 平台状态,可以了解;否则无需深入。建议在 Torch 升级后及时移除 `soft_fail` 并修复底层问题。
原始 PR · 作者 MatthewBonanni · 合并时间 2026-06-30 05:23
修复 FA4 动态因果遮罩失效问题
建议精读。该 PR 用极小的改动(+4/-1)修复了一个不易察觉的正确性问题,展示了在复杂注意力调度中因果遮罩与滑动窗口交互的关键细节。值得关注的设计决策:如何通过 `has_window` 判断决定 `causal` 参数,避免强制设为 False。
修复测试依赖固定与 xgrammar 兼容性
建议技术管理者关注此 PR 采用的依赖管理策略:将公共依赖固定在 `common.txt` 中,各平台测试依赖通过 `-r` 引用并用 `pip-compile` 生成锁定文件。这种方法值得在项目其他部分推广。测试断言的语义化改进也值得参考。
原始 PR · 作者 izhuhaoran · 合并时间 2026-06-30 05:09
V2 Model Runner 支持 Mamba hybrid 模型 align 前缀缓存
本 PR 实现清晰,讨论深入,适合希望理解 Mamba 前缀缓存在 V2 中实现细节的工程师精读。特别是 copy-free vs pre-copy 的设计权衡以及 Triton kernel 的共享技术值得学习。
原始 PR · 作者 WoosukKwon · 合并时间 2026-06-30 04:24
FlashInfer MLA 支持返回 LSE,开启 DCP 功能
值得阅读,特别是关注 MLA attention backend 如何通过 attribute 和 condition 扩展功能。设计上使用 `can_return_lse_for_decode` 类属性和 `need_to_return_lse_for_decode` 实例属性分离能力声明与运行时决策,值得参考。建议配合 PR #47079 一起合入以修复 LSE log-base 问题。
XPU RMSNorm 回退 weightless 优化
建议精读了解 XPU 平台上的 kernel dispatch 优化策略。回退逻辑清晰,评审充分,可安全合入。
简化 R-SWA 批量数据传递方式
值得快速审阅和合并,属于代码质量提升的好实践。开发者可以学习到如何消除冗余缓冲区、简化数据流。
修复 DeepseekV2Model hidden_size 引用错误
值得合并,属于规范化修复,提升代码一致性和可维护性。建议后续考虑在相似模型中推广此模式。
参与讨论