修复 Laguna 注意力门控投影未传递量化配置
值得信任。改动简单明确,风险极低,合并后可提升 Laguna 模型在量化场景下的正确性与性能。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 Laguna 注意力门控投影未传递量化配置
值得信任。改动简单明确,风险极低,合并后可提升 Laguna 模型在量化场景下的正确性与性能。
为 Ascend NPU 添加 head_dim=256 的 TND 白名单支持
建议合入,变更简单且风险低。若团队后续深度使用该类模型,可考虑补充 TND 布局的单元测试或集成测试。
原始 PR · 作者 Estrella-xx · 合并时间 2026-06-18 17:54
为 GLM-4.7-Flash 添加 MTP 支持
建议合并前处理 `torch.zeros` 的修改以提升数值稳定性,并补充基本的 MTP 精度测试。此 PR 值得关注,因其展示了在 NPU 上为 MoE 模型适配 MTP 的典型模式:通过 padding 对齐算子约束、绕过 init 时手动配置关键属性。
修复 Intern-S1 FP8 专家数属性路径
建议合入。该修复简洁且必要,已在 B300 上验证通过。
抽取 pp_proxy_tensors 关键字为统一辅助方法
值得精读的程度不高,但可以作为“小步重构”的示例:一次只消除一个重复模式,附带清晰的文档字符串。建议未来新增任何 forward 模式都使用 `_pp_kwargs`。
修复 cu12 dev 镜像构建失败的两项问题
可以直接合并。修复了构建阻塞问题,回退策略合理。建议在下次升级 torch 时统一升级所有路径中的版本固定值。
将4个KL测试从base移至extra阶段
该PR为纯粹的CI配置调整,无需深入阅读。
修复推测解码 draft worker 覆盖 target 注意力后端
值得精读。此 PR 展示了如何解决一个典型的全局状态污染 bug——通过将 per-process 配置后移至 per-object 隔离,同时保持了与旧配置的向下兼容。设计模式对于多 worker 或流水线并行的模块都具参考价值。
参与讨论