为 Intel XPU 补齐 prefill-only 模型测试覆盖
值得精读。推荐关注三点:一是 cross-encoder 数值敏感性的技术权衡——为何 bf16 下融合内核的归约顺序差异会导致超出 1e-2 容差,这是选择 attention backend 与 dtype 的关键依据;二是 decoder-only rerank 的分数提取方法(yes/no token logprob 转概率比);三是 classification 测试中"概率比较优于原始 logits 比较"的稳定性设计,以及 review 中显存双占问题的修正过程。
参与讨论