#29236 [MUSA][diffusion] Bump torchada version to 0.1.68
原始 PR · 作者 yeahdongcn · 合并时间 2026-06-26 07:53
MUSA 平台 torchada 依赖升级
属于常规依赖维护,无需精读。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 yeahdongcn · 合并时间 2026-06-26 07:53
MUSA 平台 torchada 依赖升级
属于常规依赖维护,无需精读。
CPU GDN kernel 内联状态索引,移除外部 gather
值得精读。该 PR 展示了如何将常见的外部 gather/scatter 操作通过 kernel 参数下沉到计算内部,减少 host-device 同步和数据搬运。对于优化 CPU/GPU 推理后端有参考价值。重点关注 `fla.cpp` 中索引修改和 `gdn_triton.py` 中调用侧的适配。
DP Attention 测试移除 torch.compile 掩码
此 PR 改动虽小但意义重要:修复了一个测试用例因 torch.compile 掩盖真正竞争风险的问题。建议在双流 MoE 相关 PR 中参考此调整,确保测试标志不隐藏并发问题。
原始 PR · 作者 yueming-yuan · 合并时间 2026-06-26 07:18
添加 yueming-yuan 到 CI 权限配置
该 PR 为常规权限配置变更,无需深入 review,可快速合并。
为 DeepSeek-v2 实现 Decode Context Parallelism
该 PR 设计稳健、讨论充分,值得深入阅读。特别是 DCP 的虚拟 KV 容量策略和 Triton 在线 softmax 校正内核值得关注。建议在后续 PR 中补充 MHA 模型 DCP 的测试和 FlashMLA FP8 支持。对于需要超长上下文的 DeepSeek 用户,建议升级到包含此 PR 的版本。
前向占用率测试工具增加 token TPS 报告
建议合并。该 PR 小而精,增强了测试工具的可观测性,代码变更清晰无副作用。值得关注的设计决策:将 TPS 计时放在请求内部而不是采样循环,避免了尾部采样间隔的干扰,使 TPS 更准确。
原始 PR · 作者 kkHuang-amd · 合并时间 2026-06-26 04:45
DSV4 decode 用 reduce_scatter 替代 all_reduce
该 PR 值得精读,特别是以下设计点:1)平台条件默认值的实现(`_default_hip` + `_resolve_default`),避免了模块加载时引入 torch 依赖;2)在 reduce_scatter_tensor 中插入自定义通信尝试的扩展模式;3)gatherv 与 reduce_scatter 的互斥条件设计。建议后续补充集成测试和 CUDA 图场景的专项测试。
集中FlashInfer CUTLASS MoE到统一runner
值得精读`flashinfer_cutlass.py`的设计,理解MoeRunner的fused函数注册模式,这是MoE重构的核心抽象。建议关注后续是否采纳review中的缓存建议以优化热路径性能。
参与讨论