#49033 Revert "[Sampler] Stop upcasting logits to fp32 in apply_sampling_params" (#48641)
原始 PR · 作者 vllm-agent · 合并时间 2026-07-21 16:36
回滚采样器 fp32 上转优化,修复 MTP 超时
该 PR 是标准回滚,但值得关注其揭示的采样精度敏感性:spec-decode 在低精度下数值行为微妙。建议阅读原始 PR #48641 及其回滚讨论,以了解设计权衡。
标签列表
聚合结果
原始 PR · 作者 vllm-agent · 合并时间 2026-07-21 16:36
回滚采样器 fp32 上转优化,修复 MTP 超时
该 PR 是标准回滚,但值得关注其揭示的采样精度敏感性:spec-decode 在低精度下数值行为微妙。建议阅读原始 PR #48641 及其回滚讨论,以了解设计权衡。
原始 PR · 作者 izhuhaoran · 合并时间 2026-06-30 05:09
V2 Model Runner 支持 Mamba hybrid 模型 align 前缀缓存
本 PR 实现清晰,讨论深入,适合希望理解 Mamba 前缀缓存在 V2 中实现细节的工程师精读。特别是 copy-free vs pre-copy 的设计权衡以及 Triton kernel 的共享技术值得学习。
修复 MRV2 与多种模型和配置的兼容性问题
建议相关开发者重点阅读 model_runner.py 中 `input_ids` 置 None 的条件逻辑以及 encoder_runner.py 中 `is_embed` 累加的修正,这是典型的边缘情况处理。整体 PR 可作为 MRV2 兼容性修复的参考模式。
支持 Model Runner V2 中 KV 缓存层的共享
值得精读,因涉及 MRV2 核心缓存架构的扩展。建议后续引入显式的依赖顺序解析(如拓扑排序)替代字典迭代顺序,以消除潜在顺序依赖风险。同时补充单元测试覆盖共享层在 `_allocate_kv_cache` 中的绑定逻辑。
禁用 V2 模型运行器的并行草稿解码
该 PR 是必需的 bug 修复,内容简洁、风险低。值得所有涉及 V2 模型运行器和推测解码的团队成员关注。它为 V2 并行草稿功能的后续实现提供了一个清晰的追踪点。
原始 PR · 作者 benchislett · 合并时间 2026-04-24 08:48
统一 V1 和 V2 合成拒绝采样接受率配置
建议仔细阅读 `vllm/config/speculative.py` 中的配置解析和校验逻辑(最小方差调度设计简洁),以及 Triton kernel 的改动。对于自行实现推测解码的开发者,`unconditional_to_conditional_rates` 转换函数值得复用。PR 整体设计合理,测试覆盖完整,应批准合并。