增加 DSpark speculators 格式 checkpoint 支持
值得精读。该 PR 展示了如何在现有投机解码框架中支持不同格式的检查点,涉及配置注册、模型接口设计、运行时适配三个层面。重点关注:`compute_draft_logits`/`map_draft_to_target` 的模型-运行时合约;reduced-vocab 时的散射采样策略;block 布局的动态选择。
A high-throughput and memory-efficient inference and serving engine for LLMs
增加 DSpark speculators 格式 checkpoint 支持
值得精读。该 PR 展示了如何在现有投机解码框架中支持不同格式的检查点,涉及配置注册、模型接口设计、运行时适配三个层面。重点关注:`compute_draft_logits`/`map_draft_to_target` 的模型-运行时合约;reduced-vocab 时的散射采样策略;block 布局的动态选择。
删除无人引用的 Dockerfile.nightly_torch
该 PR 是一次低风险清理,变更简单明确,无需深度审查。开发者可借此了解 `PYTORCH_NIGHTLY` 构建参数的存在,但不必花费大量时间阅读。
移除 torch_nightly 镜像标签,改用全量构建
建议精读 PR 说明中关于合并顺序的要求,确保 ci-infra#382 和 PR#47180 已部署后再合并。该变更是 CI 基础设施清理的一部分,值得运维和 CI 负责人关注。
修复 TRT-LLM FP8 MoE 缺失 OAI SwiGLU 参数导致 MXFP8 模型错误
值得精读,尤其是 trtllm_fp8_moe.py 中参数构建和 kernel 调用传递模式,展示了如何在量化后端中安全地“plumb”新参数以支持更复杂激活函数。设计决策(仅支持 uninterleaved 布局、使用 None 默认值保持向后兼容)可作为类似参数传递的参考。
FlashInfer MXFP8 量化后端指定 cute-dsl 内核
值得关注,但需验证 FlashInfer 版本兼容性,并建议添加后端不存在时的 fallback 逻辑。建议精读 FlashInfer 中 `cute-dsl` 后端的实现以评估长期维护成本。
修复 Triton paged attention 越界读 NaN 导致输出污染
建议立即合入。该 PR 修复了一个被 Claude 协助发现、WoosukKwon 称赞的精妙 bug,虽改动量小但正确性意义重大。值得精读其分析过程,理解 MRV2 预热与 KV cache 块尾 NaN 的交互。
修复 encoder-decoder 模型预热时 cross-attn 零 key 问题
值得精读,特别是理解 encoder-decoder 模型在预热中的特殊处理方式。设计简洁,对理解 vLLM 的 warmup 机制和 cross-attention 集成有参考价值。
原始 PR · 作者 lcskrishna · 合并时间 2026-07-02 03:17
修复 MoRIIO 代理 Content-Type 缺失
该 PR 为一次简单但必要的 bugfix,建议快速合并。虽然改动很小,但解决了客户端兼容性的根本问题,值得阅读以了解 Quart 代理的常见陷阱。
参与讨论