新增 DiffusionGemma 部署 cookbook 文档
值得阅读,可作为新模型接入的文档模板参考。建议关注 #27823 合入后实际运行时与文档描述的一致性。
SGLang is a high-performance serving framework for large language models and multimodal models.
新增 DiffusionGemma 部署 cookbook 文档
值得阅读,可作为新模型接入的文档模板参考。建议关注 #27823 合入后实际运行时与文档描述的一致性。
原始 PR · 作者 Kangyan-Zhou · 合并时间 2026-06-10 23:54
新增 sticky scale-up 集成测试,覆盖 true-sticky 特性
该 PR 值得查看,尤其是负责 SGLang Router 或 sticky-session 策略的工程师。它展示了如何将单元测试级别的核心属性扩展到端到端集成测试,并包含对测试前提的守卫断言(如 `healthy_workers_for` 数量),避免测试因未来变更而流于形式。
原始 PR · 作者 michaelzhang-ai · 合并时间 2026-06-10 23:41
将 8 个测试注册到 AMD CI,填补 NV→AMD 覆盖差距
本次变更是典型的 CI 覆盖增强,值得其他硬件平台(如 NPU、XPU)参考其筛选和验证流程。设计决策上,选择“不注册并禁用”而不是“注册但标记为 always skip”的策略,确保了 CI 清单的简洁性。建议关注后续是否会有类似批次将更多测试引入 AMD CI。
修复 AMD DeepSeek V4 内核 dtype 不匹配并因性能回归被 revert
不推荐作为最终方案精读。核心里程碑是模板参数化设计本身有参考价值,但需要结合性能回归进行重新设计。建议关注后续 PR #27919 (revert) 及后续改进。
修复 MiMo-V2.5-Pro DP-attention 部署命令生成错误
该 PR 是典型的文档级 bugfix,虽然改动量小且不涉及运行时代码,但其对 DP-attention 与 TP 交错检查点的约束关系的澄清具有学习价值。建议所有部署 MiMo 系列模型的用户关注此变更,确保生成的部署命令正确。代码架构上,使用 `spec.dp` 的统一约束模式(而非硬编码 `!isPro` 分支)值得推广到其他需要类似约束的模型。
新增KDA SM100 CuteDSL预填充内核
建议深入阅读`__init__.py`中的数值修复方案(sub-chunk归一化处理per-channel gate)和`_kda_workspace`的缓存设计,是高性能算子实现的优秀示例。同时了解如何通过TMA和MMA编程在Blackwell上实现高效sequence-parallel内核。
修复 ngram 书签所有权失效测试
该 PR 改动简单但有必要,值得合并以维护测试可靠性。
移除 AMD DSv4 Docker 发布任务
值得快速合并,属于常规的 CI 清理。开发者应关注后续是否还有其他依赖于 `publish_dsv4` 的流程。
参与讨论