#46761 [DFlash] Fuse precompute kv per-layer rmsnorms
原始 PR · 作者 TheEpicDolphin · 合并时间 2026-06-26 10:32
融合 DFlash 各层 K-norm 为单次 kernel 调用
该 PR 值得精读,展示了典型的 kernel 泛化 + 测试驱动重构模式。通过扩展底层 kernel 支持 batched weight 来消除循环,并用细粒度测试保证正确性,设计思路清晰。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 TheEpicDolphin · 合并时间 2026-06-26 10:32
融合 DFlash 各层 K-norm 为单次 kernel 调用
该 PR 值得精读,展示了典型的 kernel 泛化 + 测试驱动重构模式。通过扩展底层 kernel 支持 batched weight 来消除循环,并用细粒度测试保证正确性,设计思路清晰。
原始 PR · 作者 EanWang211123 · 合并时间 2026-06-26 10:30
减少推测解码中的 TP 通信开销
此 PR 是一次简洁高效的性能优化,改动小而收益明确。推荐阅读其实现思路:通过配置开关控制通信策略,避免全 vocab 的 all-gather,利用 `get_top_tokens` 接口只传递 top-1 token。该模式可推广到其他需要减少通信的场景。建议后续补充单元测试以覆盖新增的校验逻辑和采样路径。
原始 PR · 作者 TheEpicDolphin · 合并时间 2026-06-26 10:29
修复 DFlash 注意力后端选择问题
可作为示例参考:如何将 speculative config 的参数传递至草稿模型配置。
修复 mamba 混合模型启动崩溃
低风险紧急 bugfix,建议快速合并。可配合后续 PR 添加 mamba 混合模型的 V2 运行器测试。
原始 PR · 作者 yewentao256 · 合并时间 2026-06-26 09:09
移除死内核代码与过时测试
值得合入。清理死代码是良好的工程实践。无需额外测试,但建议在合并前确认 CI 通过(从已批准看应已通过)。
限制大 logprobs 请求时的显存爆炸
建议精读此 PR,以学习如何用分块方式避免 Triton 内核中编译时常量过大导致的显存问题。该设计模式可推广到其他类似的 gather/scatter 场景。
修复量化模型 tied embeddings 加载崩溃
建议优先合并此修复,并确认 Cherry-pick 到 v0.24.0 稳定版(Issue 评论指出该修复未进入 v0.24.0,导致稳定版用户无法使用 ModelOpt 量化模型)。
将 Rust 前端的 TLS 实现从 rustls 切换到 native-tls/OpenSSL,并添加依赖禁止检查。
该 PR 值得关注其依赖治理策略,特别是通过 cargo-deny 建立禁止列表和利用 Cargo feature unification 确保 TLS 一致性的方法。适合作为基础设施团队依赖管理的参考案例。
参与讨论