Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15

PR 列表

更多筛选
2026-07-02
功能 重要性 8.02 洞察度 6.00

增加 DSpark speculators 格式 checkpoint 支持

值得精读。该 PR 展示了如何在现有投机解码框架中支持不同格式的检查点,涉及配置注册、模型接口设计、运行时适配三个层面。重点关注:`compute_draft_logits`/`map_draft_to_target` 的模型-运行时合约;reduced-vocab 时的散射采样策略;block 布局的动态选择。

#47338 [Docker] Remove unused Dockerfile.nightly_torch

原始 PR · 作者 atalman · 合并时间 2026-07-02 07:19

基础设施 重要性 5.62 洞察度 2.00

删除无人引用的 Dockerfile.nightly_torch

该 PR 是一次低风险清理,变更简单明确,无需深度审查。开发者可借此了解 `PYTORCH_NIGHTLY` 构建参数的存在,但不必花费大量时间阅读。

缺陷修复 重要性 6.60 洞察度 5.00

修复 TRT-LLM FP8 MoE 缺失 OAI SwiGLU 参数导致 MXFP8 模型错误

值得精读,尤其是 trtllm_fp8_moe.py 中参数构建和 kernel 调用传递模式,展示了如何在量化后端中安全地“plumb”新参数以支持更复杂激活函数。设计决策(仅支持 uninterleaved 布局、使用 None 默认值保持向后兼容)可作为类似参数传递的参考。

#47229 [DSV4] Better MXFP8 quantization kernel

原始 PR · 作者 zyongye · 合并时间 2026-07-02 05:33

性能优化 重要性 5.08 洞察度 4.00

FlashInfer MXFP8 量化后端指定 cute-dsl 内核

值得关注,但需验证 FlashInfer 版本兼容性,并建议添加后端不存在时的 fallback 逻辑。建议精读 FlashInfer 中 `cute-dsl` 后端的实现以评估长期维护成本。

缺陷修复 重要性 4.24 洞察度 7.00

修复 Triton paged attention 越界读 NaN 导致输出污染

建议立即合入。该 PR 修复了一个被 Claude 协助发现、WoosukKwon 称赞的精妙 bug,虽改动量小但正确性意义重大。值得精读其分析过程,理解 MRV2 预热与 KV cache 块尾 NaN 的交互。

缺陷修复 重要性 6.11 洞察度 5.00

修复 encoder-decoder 模型预热时 cross-attn 零 key 问题

值得精读,特别是理解 encoder-decoder 模型在预热中的特殊处理方式。设计简洁,对理解 vLLM 的 warmup 机制和 cross-attention 集成有参考价值。

参与讨论