Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-07-02
性能优化 重要性 3.84 洞察度 3.00

用CUDA函数替代PTX内联汇编实现PDL指令

本PR是一个典型的CUDA kernel清理工作,值得其他kernel模块借鉴。虽然改动不大,但展示了如何将PTX替换为官方API并引入实用启发式。建议有SM90+硬件的团队验证性能,并考虑将PDL阈值变为可配置参数。

功能 重要性 8.02 洞察度 6.00

增加 DSpark speculators 格式 checkpoint 支持

值得精读。该 PR 展示了如何在现有投机解码框架中支持不同格式的检查点,涉及配置注册、模型接口设计、运行时适配三个层面。重点关注:`compute_draft_logits`/`map_draft_to_target` 的模型-运行时合约;reduced-vocab 时的散射采样策略;block 布局的动态选择。

#47338 [Docker] Remove unused Dockerfile.nightly_torch

原始 PR · 作者 atalman · 合并时间 2026-07-02 07:19

基础设施 重要性 5.62 洞察度 2.00

删除无人引用的 Dockerfile.nightly_torch

该 PR 是一次低风险清理,变更简单明确,无需深度审查。开发者可借此了解 `PYTORCH_NIGHTLY` 构建参数的存在,但不必花费大量时间阅读。

缺陷修复 重要性 6.60 洞察度 5.00

修复 TRT-LLM FP8 MoE 缺失 OAI SwiGLU 参数导致 MXFP8 模型错误

值得精读,尤其是 trtllm_fp8_moe.py 中参数构建和 kernel 调用传递模式,展示了如何在量化后端中安全地“plumb”新参数以支持更复杂激活函数。设计决策(仅支持 uninterleaved 布局、使用 None 默认值保持向后兼容)可作为类似参数传递的参考。

#47229 [DSV4] Better MXFP8 quantization kernel

原始 PR · 作者 zyongye · 合并时间 2026-07-02 05:33

性能优化 重要性 5.08 洞察度 4.00

FlashInfer MXFP8 量化后端指定 cute-dsl 内核

值得关注,但需验证 FlashInfer 版本兼容性,并建议添加后端不存在时的 fallback 逻辑。建议精读 FlashInfer 中 `cute-dsl` 后端的实现以评估长期维护成本。

缺陷修复 重要性 4.24 洞察度 7.00

修复 Triton paged attention 越界读 NaN 导致输出污染

建议立即合入。该 PR 修复了一个被 Claude 协助发现、WoosukKwon 称赞的精妙 bug,虽改动量小但正确性意义重大。值得精读其分析过程,理解 MRV2 预热与 KV cache 块尾 NaN 的交互。

参与讨论