2026-08-20
新增 trace_decode_token_ids 实现确定性解码重放
值得精读。重点关注:采样后注入再算 logprob 的顺序设计、以 GPU 状态推导 step 避免 CPU 同步、UVA `StagedWriteTensor` 的批量写入模式、以及“配置开关 + 输入归一化 + 统一校验”三层防护。对想扩展 MRV2 sampler 或实现类似重放/调试功能的工程师是很好的参考。合并前建议在 GPU 上跑通 `examples/generate/trace_replay_offline.py` 端到端验证。
修复 ROCm CUDA graph capture 时 CPU query offset 被清除
值得精读,尤其是关注 ROCm CUDA graph capture 细节的开发者。该 PR 揭示了一个隐藏在共享 metadata 状态下的时序问题,并提供了最小化的修复方案,展示在性能和安全捕获之间的权衡。可作为处理类似共享状态清理问题的参考案例。
优化 GDN 元数据构建重复 mask 计算
该 PR 是一个小范围性能优化,逻辑清晰,风险低,值得合并。但建议补充相关单元测试以覆盖 spec decode 边界情况,防止未来回归。
KV 校验预留 null block,修复 max_model_len 边界启动后挂起
值得精读。核心价值在于"容量校验必须与分配约束(BlockPool null block 预留)保持一致"的设计原则,以及把边界 bug 从 override 单一路径推广到所有来源的正确做法——在 available_memory 折算点做单点修复,避免多路径各自打补丁。review 中 njhill 关于把扣减提升到 auto-fit 之前的讨论、malaiwah 的混合 Mamba 复现矩阵与 #52530 的分工,都值得参考。
默认启用 FlashInfer all-reduce 并跳过批不变模式
值得精读,重点关注默认开启带来的性能变化以及批不变模式的兼容性处理。建议运行更多平台和形状的测试以验证鲁棒性。
整合 CP 注意力算子到统一目录,纯重构无行为变更
值得阅读:一是 cp_common.py 如何把 symmetric-memory 探测、能力门控、workspace 生命周期拆成可复用层,这是后续 prefill fused ops 的公共底座;二是 dcp.py 的模块内组织(LSE combine、Q/KV gather、manager 分区)可作为 CP 算子标准布局参考。对维护者:合并前建议用工具核对 diff 确认为纯移动(如 git diff --word-diff 对比重命名后文件),并安排一次 DCP 模式精度回归。值得跟踪该 PR 的 follow-up(prefill pcp fused ops)。
Mooncake Store 消费者新增 decode KV 卸载能力
值得精读。重点关注 4 个设计决策:(1)用 `store_job_id` 账本替代按 req_id 计数,抵御 preemption 与请求 ID 复用带来的状态污染;(2)KV event 的 parent 关系从 request hash 链推导,而非依赖 Store 返回顺序;(3)增量 token 快照加按功能开关裁剪元数据,避免长请求全量拷贝;(4)异步 store 生命周期下“调度器只持有 token 后缀、GPU block 由 worker 报告完成才释放”的 pin 语义。
修复 gumbel_sample 缓存列 stride 错误,避免错位写入
此 PR 值得精读,它展示了一个典型的 stride 计算 bug 的修复过程,并且测试用例设计良好,覆盖了跨步写入隔离和边界拒绝场景。对于理解 Triton kernel 中张量步长处理很有参考价值。建议关注后续是否有更多针对 gumbel_sample 的优化。