#43761 [Frontend]Responses API supports chat_template_kwargs
原始 PR · 作者 chaunceyjiang · 合并时间 2026-05-29 15:58
Responses API 支持 chat_template_kwargs 传递
修复明确、风险低、影响集中在特定模型配置场景。建议阅读以了解 Responses API 与 chat_template_kwargs 的交互逻辑。无需精读。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 chaunceyjiang · 合并时间 2026-05-29 15:58
Responses API 支持 chat_template_kwargs 传递
修复明确、风险低、影响集中在特定模型配置场景。建议阅读以了解 Responses API 与 chat_template_kwargs 的交互逻辑。无需精读。
消除稀疏注意力 GPU 气泡
建议合入。此 PR 很好地展示了如何通过消除 GPU 微气泡来提升性能,是 ROCm 上 DSv4 推理链路中的一次精细优化。值得关注的设计点:用 `torch.zeros` 合并赋值操作减少 kernel launch、用已知 host 值替代 D2H 同步获取 `indptr[-1]`。
CPU top-k/top-p 采样切换到 Triton 实现
本 PR 虽改动量小,但展示了在 CPU 后端使用 Triton 的典型模式:调整 block size、条件编译、集成测试。值得关注其设计权衡和 CI 集成方式。建议阅读以了解 vLLM CPU 后端的优化方向。
原始 PR · 作者 yintong-lu · 合并时间 2026-05-29 14:37
XPU MoE 支持 gelu_tanh 激活函数
该 PR 为简单的兼容性修复,建议快速合并,但需确保关联的 xpu-kernels PR 已合入并更新依赖。
将非 root smoke 测试从镜像构建步骤中分离
建议快速合并。这是一个纯粹的 CI 改进,逻辑清晰,风险极低,能有效提升 CI 可见性和效率。
原始 PR · 作者 cleonard530 · 合并时间 2026-05-29 12:44
迁移注意力与缓存内核至 torch stable ABI
此 PR 是持续 ABI 迁移的重要一环,值得核心开发者精读。重点关注 `concat_mla_q` 调度类型迁移的修复过程、头文件移动策略的讨论、以及 `quant_utils.cuh` 部分稳定性的权衡。这些模式将指导后续阶段。 普通审阅者应关注构建是否正确、测试是否覆盖以避免回归。 建议团队在后续 PR 中尽快完成 `quant_utils.cuh` 的完全迁移,并考虑为缓存操作添加更多单元测试。
原始 PR · 作者 yewentao256 · 合并时间 2026-05-29 12:29
跨模块移除不可达死代码与废弃配置
该 PR 是良好的常规清理,值得关注每个删除项的理由。尤其推荐注意 longcat_flash_mtp 分支被前序逻辑覆盖的设计模式,以及 fused_moe 中如何通过删除参数来消除死分支。对于代码审查者,建议验证每个删除确实无外部依赖。
跳过 decode 阶段 KV block 的 CPU 卸载
值得精读,特别是如何通过 clamp 操作实现大幅性能提升,以及 Review 过程中设计演进(默认值、命名)的决策思路。
参与讨论