Prhub

#27473 Fix TRTLLM target verify query metadata

原始 PR 作者 merrymercy 合并时间 2026-06-07 17:46 文件变更 1 提交数 1 评论 2 代码增减 +0 / -1

执行摘要

移除 TRTLLM target-verify 中 query length 的强制覆盖

修复 target-verify CUDA graph 元数据中 query length 被错误覆盖的问题,确保其与实际请求形状一致,避免潜在的 CUDA graph 执行错误。

建议合并,变更简单且逻辑正确。

讨论亮点

无 review 评论。

实现拆解

移除 trtllm_mha_backend.py_apply_cuda_graph_metadata 方法里 target_verify 分支末尾的 metadata.max_seq_len_q = self.speculative_num_draft_tokens 赋值语句。该语句在完成所有元数据填充后强制覆盖了 query length,而其他分支均保留从捕获形状派生的值。

文件 模块 状态 重要度
python/sglang/srt/layers/attention/trtllm_mha_backend.py 注意力 modified 4.35

关键符号

_apply_cuda_graph_metadata

分析完成后,这里会展示 LLM 生成的相对完整源码片段和详细注释。

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

风险极低,涉及单行删除,且变更已在 body 中通过 py_compile 验证。若上游代码有其他处依赖该覆盖值,需确认,但当前代码逻辑表明该赋值多余。

影响范围小,仅影响 Blackwell 平台下 TRTLLM 后端的 target-verify CUDA graph 元数据。修复后 query length 保持一致,避免潜在图执行错误。

极低风险

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论