#26312 [mtp] add rejection sampling for speculative decoding
原始 PR · 作者 liyucheng09 · 合并时间 2026-06-21 06:10
为 speculative decoding 添加经典拒绝采样,提升接受长度和吞吐
建议架构师和服务化团队精读此 PR,特别是 `reject_sampling.py` 中 Triton 内核的两轮残差采样实现,该模式可复用于其他需要从修正分布采样的场景。同时,review 中关于缓冲区使用的对话也体现了 CUDA Graph 场景下组件间契约设计的良好实践。
参与讨论