修复 arm64 MoE 内核函数签名不一致
该 PR 为典型的跨平台签名同步修复,变更简洁且必要。开发者可以快速了解 ARM64 平台如何维护函数签名一致性。值得关注的是作者采用的方式是将公共声明统一化,而非为 ARM64 保留特殊路径,这种设计值得借鉴。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 arm64 MoE 内核函数签名不一致
该 PR 为典型的跨平台签名同步修复,变更简洁且必要。开发者可以快速了解 ARM64 平台如何维护函数签名一致性。值得关注的是作者采用的方式是将公共声明统一化,而非为 ARM64 保留特殊路径,这种设计值得借鉴。
原始 PR · 作者 LijuanTang94 · 合并时间 2026-06-26 07:53
修复 MLX 单元测试使用过时的 stash() API
该 PR 是典型的 API 重构后未同步测试的反例,值得注意:当核心函数签名变更时,应系统地检查所有调用点(包括测试)。建议精读以了解 `RelayPayload` 的用法。
原始 PR · 作者 yeahdongcn · 合并时间 2026-06-26 07:53
MUSA 平台 torchada 依赖升级
属于常规依赖维护,无需精读。
CPU GDN kernel 内联状态索引,移除外部 gather
值得精读。该 PR 展示了如何将常见的外部 gather/scatter 操作通过 kernel 参数下沉到计算内部,减少 host-device 同步和数据搬运。对于优化 CPU/GPU 推理后端有参考价值。重点关注 `fla.cpp` 中索引修改和 `gdn_triton.py` 中调用侧的适配。
DP Attention 测试移除 torch.compile 掩码
此 PR 改动虽小但意义重要:修复了一个测试用例因 torch.compile 掩盖真正竞争风险的问题。建议在双流 MoE 相关 PR 中参考此调整,确保测试标志不隐藏并发问题。
原始 PR · 作者 yueming-yuan · 合并时间 2026-06-26 07:18
添加 yueming-yuan 到 CI 权限配置
该 PR 为常规权限配置变更,无需深入 review,可快速合并。
为 DeepSeek-v2 实现 Decode Context Parallelism
该 PR 设计稳健、讨论充分,值得深入阅读。特别是 DCP 的虚拟 KV 容量策略和 Triton 在线 softmax 校正内核值得关注。建议在后续 PR 中补充 MHA 模型 DCP 的测试和 FlashMLA FP8 支持。对于需要超长上下文的 DeepSeek 用户,建议升级到包含此 PR 的版本。
前向占用率测试工具增加 token TPS 报告
建议合并。该 PR 小而精,增强了测试工具的可观测性,代码变更清晰无副作用。值得关注的设计决策:将 TPS 计时放在请求内部而不是采样循环,避免了尾部采样间隔的干扰,使 TPS 更准确。
参与讨论