修复 attention 权重重载后 CUDA graph 引用过期 tensor
建议尽快合并并 cherry-pick 到相关分支。本 PR 贡献了一个清晰的权重重载时 tensor 地址保持的设计范式,值得其他类似场景参考。`replace_parameter` 的用法可作为最佳实践传播。
A high-throughput and memory-efficient inference and serving engine for LLMs
修复 attention 权重重载后 CUDA graph 引用过期 tensor
建议尽快合并并 cherry-pick 到相关分支。本 PR 贡献了一个清晰的权重重载时 tensor 地址保持的设计范式,值得其他类似场景参考。`replace_parameter` 的用法可作为最佳实践传播。
原始 PR · 作者 Debasish-87 · 合并时间 2026-07-17 14:00
新增 blocks_per_chunk 配置支持异构 KV 缓存
建议精读以了解配置扩展模式。关注 `build_offloading_config` 中互斥校验的实现思路,可作为后续类似配置扩展的参考。
原始 PR · 作者 woosebastian · 合并时间 2026-07-17 13:19
修复 torch.compile 下 chunked prefill 错误分数
该 PR 涉及 torch.compile 与异步调度交互的典型案例,值得精读。修复本身虽简单,但问题排查过程(差值分析、同步实验)对理解编译图生命周期有启发。建议关注后续改进方案。
新增 derender 往返测试与文档,修复工具调用 content 为 null 的 bug
该 PR 值得精读,尤其是以下几点: 1. 测试设计(使用同一生成的 token IDs 对比两个解析路径)可复用于其他分离式服务的验证。 2. 文档中采用 `--8<--` snippet 直接嵌入模型定义,保证单一事实来源,是编写 API 文档的推荐模式。 3. 团队有关代码复用的讨论(derender vs coupled 路径)为后续重构提供了清晰的方向。
延长测试模型长度上限,修复推理不完整
可作为临时修复合入,但建议尽快跟进分析推理 token 用量波动的原因,并考虑是否完全移除 max_model_len 限制以彻底解决 flaky 问题。
原始 PR · 作者 WoosukKwon · 合并时间 2026-07-17 11:17
显示 CuTeDSL 内核编译进度条
该 PR 功能清晰、改动简洁,可直接合入。值得关注的设计决策是:利用 `is_global_first_rank()` 限制进度条输出,这是一种典型的分布式场景下避免冗余输出的模式,可在类似场景(如预热多个组件)复用。
原始 PR · 作者 WoosukKwon · 合并时间 2026-07-17 09:52
为 Inkling 模型添加完整的 LoRA 适配支持,涵盖注意力、MoE 及 lm_head
值得精读。该 PR 展示了在复杂 MoE 架构(共享 sink expert、共享-outer 布局、muP 缩放)中集成 LoRA 的系统性方法,设计决策(如条件选择线性层、检测包装器分流、共享 expert 维为 1 的存储模型)有参考价值。建议关注 InklingSinkExpertsLinear 的 _gamma_expand 实现和 _lora_forward 的 muP 合成逻辑。由于缺少真实适配器评估,在实际部署前应进行充分测试。
原始 PR · 作者 gau-nernst · 合并时间 2026-07-17 09:12
为 M3 长上下文 decode 添加 CuteDSL indexer 内核,支持 FP8 和 BF16
该 PR 值得精读,尤其是 CuteDSL kernel 设计思路(TMA+mma.sync 对比 tcgen05 的权衡)以及 fallback 策略。合并后无已知回归,但建议关注后续其他 CuteDSL 模块是否顺利迁移至 `mma_sync` 接口。
参与讨论