Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-06-11

#27824 docs: Diffusion Gemma cookbook

原始 PR · 作者 kpham-sgl · 合并时间 2026-06-11 00:33

文档 重要性 4.86 洞察度 3.00

新增 DiffusionGemma 部署 cookbook 文档

值得阅读,可作为新模型接入的文档模板参考。建议关注 #27823 合入后实际运行时与文档描述的一致性。

2026-06-10
测试 重要性 5.97 洞察度 3.00

新增 sticky scale-up 集成测试,覆盖 true-sticky 特性

该 PR 值得查看,尤其是负责 SGLang Router 或 sticky-session 策略的工程师。它展示了如何将单元测试级别的核心属性扩展到端到端集成测试,并包含对测试前提的守卫断言(如 `healthy_workers_for` 数量),避免测试因未来变更而流于形式。

基础设施 重要性 4.62 洞察度 4.00

将 8 个测试注册到 AMD CI,填补 NV→AMD 覆盖差距

本次变更是典型的 CI 覆盖增强,值得其他硬件平台(如 NPU、XPU)参考其筛选和验证流程。设计决策上,选择“不注册并禁用”而不是“注册但标记为 always skip”的策略,确保了 CI 清单的简洁性。建议关注后续是否会有类似批次将更多测试引入 AMD CI。

修复 AMD DeepSeek V4 内核 dtype 不匹配并因性能回归被 revert

不推荐作为最终方案精读。核心里程碑是模板参数化设计本身有参考价值,但需要结合性能回归进行重新设计。建议关注后续 PR #27919 (revert) 及后续改进。

缺陷修复 重要性 6.00 洞察度 4.00

修复 MiMo-V2.5-Pro DP-attention 部署命令生成错误

该 PR 是典型的文档级 bugfix,虽然改动量小且不涉及运行时代码,但其对 DP-attention 与 TP 交错检查点的约束关系的澄清具有学习价值。建议所有部署 MiMo 系列模型的用户关注此变更,确保生成的部署命令正确。代码架构上,使用 `spec.dp` 的统一约束模式(而非硬编码 `!isPro` 分支)值得推广到其他需要类似约束的模型。

#27488 [KDA] Add CuteDSL Prefill Kernel on SM100

原始 PR · 作者 yuan-luo · 合并时间 2026-06-10 21:25

功能 重要性 9.36 洞察度 7.00

新增KDA SM100 CuteDSL预填充内核

建议深入阅读`__init__.py`中的数值修复方案(sub-chunk归一化处理per-channel gate)和`_kda_workspace`的缓存设计,是高性能算子实现的优秀示例。同时了解如何通过TMA和MMA编程在Blackwell上实现高效sequence-parallel内核。

#27795 [CI] Remove AMD DSv4 Docker publish job

原始 PR · 作者 1am9trash · 合并时间 2026-06-10 17:50

基础设施 重要性 4.63 洞察度 2.00

移除 AMD DSv4 Docker 发布任务

值得快速合并,属于常规的 CI 清理。开发者应关注后续是否还有其他依赖于 `publish_dsv4` 的流程。

参与讨论