Prhub

vllm-project/vllm · 标签视图

标签列表

聚合结果

v1 相关 PR

2026-08-20
功能 重要性 9.18 洞察度 6.00

新增 trace_decode_token_ids 实现确定性解码重放

值得精读。重点关注:采样后注入再算 logprob 的顺序设计、以 GPU 状态推导 step 避免 CPU 同步、UVA `StagedWriteTensor` 的批量写入模式、以及“配置开关 + 输入归一化 + 统一校验”三层防护。对想扩展 MRV2 sampler 或实现类似重放/调试功能的工程师是很好的参考。合并前建议在 GPU 上跑通 `examples/generate/trace_replay_offline.py` 端到端验证。

缺陷修复 重要性 5.02 洞察度 5.00

修复 ROCm CUDA graph capture 时 CPU query offset 被清除

值得精读,尤其是关注 ROCm CUDA graph capture 细节的开发者。该 PR 揭示了一个隐藏在共享 metadata 状态下的时序问题,并提供了最小化的修复方案,展示在性能和安全捕获之间的权衡。可作为处理类似共享状态清理问题的参考案例。

性能优化 重要性 6.04 洞察度 5.00

优化 GDN 元数据构建重复 mask 计算

该 PR 是一个小范围性能优化,逻辑清晰,风险低,值得合并。但建议补充相关单元测试以覆盖 spec decode 边界情况,防止未来回归。

缺陷修复 重要性 7.24 洞察度 6.00

KV 校验预留 null block,修复 max_model_len 边界启动后挂起

值得精读。核心价值在于"容量校验必须与分配约束(BlockPool null block 预留)保持一致"的设计原则,以及把边界 bug 从 override 单一路径推广到所有来源的正确做法——在 available_memory 折算点做单点修复,避免多路径各自打补丁。review 中 njhill 关于把扣减提升到 auto-fit 之前的讨论、malaiwah 的混合 Mamba 复现矩阵与 #52530 的分工,都值得参考。

功能 重要性 5.64 洞察度 5.00

默认启用 FlashInfer all-reduce 并跳过批不变模式

值得精读,重点关注默认开启带来的性能变化以及批不变模式的兼容性处理。建议运行更多平台和形状的测试以验证鲁棒性。

#52839 [refactor] consolidate cp attn ops

原始 PR · 作者 GirasoleY · 合并时间 2026-08-20 09:04

重构 重要性 8.48 洞察度 4.00

整合 CP 注意力算子到统一目录,纯重构无行为变更

值得阅读:一是 cp_common.py 如何把 symmetric-memory 探测、能力门控、workspace 生命周期拆成可复用层,这是后续 prefill fused ops 的公共底座;二是 dcp.py 的模块内组织(LSE combine、Q/KV gather、manager 分区)可作为 CP 算子标准布局参考。对维护者:合并前建议用工具核对 diff 确认为纯移动(如 git diff --word-diff 对比重命名后文件),并安排一次 DCP 模式精度回归。值得跟踪该 PR 的 follow-up(prefill pcp fused ops)。

功能 重要性 8.54 洞察度 7.00

Mooncake Store 消费者新增 decode KV 卸载能力

值得精读。重点关注 4 个设计决策:(1)用 `store_job_id` 账本替代按 req_id 计数,抵御 preemption 与请求 ID 复用带来的状态污染;(2)KV event 的 parent 关系从 request hash 链推导,而非依赖 Store 返回顺序;(3)增量 token 快照加按功能开关裁剪元数据,避免长请求全量拷贝;(4)异步 store 生命周期下“调度器只持有 token 后缀、GPU block 由 worker 报告完成才释放”的 pin 语义。

缺陷修复 重要性 6.50 洞察度 5.00

修复 gumbel_sample 缓存列 stride 错误,避免错位写入

此 PR 值得精读,它展示了一个典型的 stride 计算 bug 的修复过程,并且测试用例设计良好,覆盖了跨步写入隔离和边界拒绝场景。对于理解 Triton kernel 中张量步长处理很有参考价值。建议关注后续是否有更多针对 gumbel_sample 的优化。