Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 20:44 同步状态:空闲 下次计划:2026-08-21 21:44

PR 列表

更多筛选
2026-07-17
缺陷修复 重要性 6.83 洞察度 5.00

修复 attention 权重重载后 CUDA graph 引用过期 tensor

建议尽快合并并 cherry-pick 到相关分支。本 PR 贡献了一个清晰的权重重载时 tensor 地址保持的设计范式,值得其他类似场景参考。`replace_parameter` 的用法可作为最佳实践传播。

缺陷修复 重要性 6.32 洞察度 7.00

修复 torch.compile 下 chunked prefill 错误分数

该 PR 涉及 torch.compile 与异步调度交互的典型案例,值得精读。修复本身虽简单,但问题排查过程(差值分析、同步实验)对理解编译图生命周期有启发。建议关注后续改进方案。

功能 重要性 7.71 洞察度 6.00

新增 derender 往返测试与文档,修复工具调用 content 为 null 的 bug

该 PR 值得精读,尤其是以下几点: 1. 测试设计(使用同一生成的 token IDs 对比两个解析路径)可复用于其他分离式服务的验证。 2. 文档中采用 `--8<--` snippet 直接嵌入模型定义,保证单一事实来源,是编写 API 文档的推荐模式。 3. 团队有关代码复用的讨论(derender vs coupled 路径)为后续重构提供了清晰的方向。

#48881 [Warmup] Show CuTeDSL compilation progress

原始 PR · 作者 WoosukKwon · 合并时间 2026-07-17 11:17

功能 重要性 5.42 洞察度 2.00

显示 CuTeDSL 内核编译进度条

该 PR 功能清晰、改动简洁,可直接合入。值得关注的设计决策是:利用 `is_global_first_rank()` 限制进度条输出,这是一种典型的分布式场景下避免冗余输出的模式,可在类似场景(如预热多个组件)复用。

#48884 [Model] Add Inkling LoRA support [4/N]

原始 PR · 作者 WoosukKwon · 合并时间 2026-07-17 09:52

功能 重要性 8.94 洞察度 6.00

为 Inkling 模型添加完整的 LoRA 适配支持,涵盖注意力、MoE 及 lm_head

值得精读。该 PR 展示了在复杂 MoE 架构(共享 sink expert、共享-outer 布局、muP 缩放)中集成 LoRA 的系统性方法,设计决策(如条件选择线性层、检测包装器分流、共享 expert 维为 1 的存储模型)有参考价值。建议关注 InklingSinkExpertsLinear 的 _gamma_expand 实现和 _lora_forward 的 muP 合成逻辑。由于缺少真实适配器评估,在实际部署前应进行充分测试。

性能优化 重要性 8.74 洞察度 7.00

为 M3 长上下文 decode 添加 CuteDSL indexer 内核,支持 FP8 和 BF16

该 PR 值得精读,尤其是 CuteDSL kernel 设计思路(TMA+mma.sync 对比 tcgen05 的权衡)以及 fallback 策略。合并后无已知回归,但建议关注后续其他 CuteDSL 模块是否顺利迁移至 `mma_sync` 接口。

参与讨论