执行摘要
移除 TRTLLM target-verify 中 query length 的强制覆盖
修复 target-verify CUDA graph 元数据中 query length 被错误覆盖的问题,确保其与实际请求形状一致,避免潜在的 CUDA graph 执行错误。
建议合并,变更简单且逻辑正确。
无 review 评论。
修复 target-verify CUDA graph 元数据中 query length 被错误覆盖的问题,确保其与实际请求形状一致,避免潜在的 CUDA graph 执行错误。
建议合并,变更简单且逻辑正确。
无 review 评论。
移除 trtllm_mha_backend.py 中 _apply_cuda_graph_metadata 方法里 target_verify 分支末尾的 metadata.max_seq_len_q = self.speculative_num_draft_tokens 赋值语句。该语句在完成所有元数据填充后强制覆盖了 query length,而其他分支均保留从捕获形状派生的值。
| 文件 | 模块 | 状态 | 重要度 |
|---|---|---|---|
python/sglang/srt/layers/attention/trtllm_mha_backend.py |
注意力 | modified | 4.35 |
分析完成后,这里会展示 LLM 生成的相对完整源码片段和详细注释。
当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。
风险极低,涉及单行删除,且变更已在 body 中通过 py_compile 验证。若上游代码有其他处依赖该覆盖值,需确认,但当前代码逻辑表明该赋值多余。
影响范围小,仅影响 Blackwell 平台下 TRTLLM 后端的 target-verify CUDA graph 元数据。修复后 query length 保持一致,避免潜在图执行错误。
当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。
参与讨论