Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 17:58 同步状态:空闲 下次计划:2026-09-01 18:58
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-08-12
性能优化 重要性 8.93 洞察度 6.00

H3 参考视频按主机单次解码并共享映射,存储降 87.5%

值得精读。重点关注 `_decode_reference_video_shared` 中“两轮 collective 保证决策一致”的设计:第一轮广播 decode 状态与失败,第二轮广播 mapping 状态与失败,任何异常都整体回退而不是让某个 rank 单独失败;这是多 rank 共享内存类优化中容易踩坑的地方。其次关注 text/visual 两个 stage 对 `MINIMAX_H3_PREPARED_REFERENCE_VIDEO_EXTRA_KEY` 生命周期的 finally 清理,以及 `_MINIMAX_H3_SINGLE_RANK_TEXT_ENCODE_EXTRA_KEY` 在 DP 广播路径上禁用共享的细节。

基础设施 重要性 4.85 洞察度 4.00

新增 GLM-5.2 MXFP4 wide-EP16 2P1D 夜间测试配方

值得快速浏览,作为了解 SGLang 在 AMD 上 wide-EP 和 MTP 配置的参考。重点关注 `wide_ep` 参数、MoRI 环境变量和 MTP 配置块。注意检查模型路径一致性。

#34379 [AMD] GLM 5.2 MXFP4 SGLANG COOKBOOK

原始 PR · 作者 ajith-sirra-amd · 合并时间 2026-08-12 18:39

文档 重要性 5.66 洞察度 4.00

GLM-5.2 cookbook 新增 AMD MI355X MXFP4 部署配方

值得浏览(不必精读):这是标准的 cookbook 配置扩展 PR,展示了 SGLang 文档配置系统(Mintlify snippets + JSX config)如何组织多硬件/多量化组合的部署矩阵,以及如何在未验证状态下通过 disable/enable 门控与 verified: false 标记管理文档诚实性。值得关注的设计决策:1) 用 `"hw|quant"` 复合键在 dockerImages 中做细粒度镜像覆盖;2) 用 `enable`/`enableReason` 门控只对特定 hw+quant 组合开放 MTP 选项;3) 对 gfx950 专属能力(MXFP4、MTP 3-1-4)的显式范围界定。后续可跟进其 TODO 中的准确率/速度数据是否在后续 PR 中补齐并翻转 verified 标记。

基础设施 重要性 6.17 洞察度 6.00

AMD PR 门禁切换至 ROCm 7.2,7.0 降为每日影子

该 PR 值得精读,尤其是 CI 门禁迁移策略、shadow 套件设计、任务归类和超时调整的实践。关注点:1) 从 7.0 重新生成 7.2 工作流以减少漂移的做法值得借鉴;2) 通过拆分 PR(如 Triton 安装)解耦风险和依赖;3) 将慢速夜间任务纳入 PR 门禁但缩短超时并修复退出码掩盖问题。

重构 重要性 6.54 洞察度 5.00

抑制 diffusion worker 启动期依赖库噪声告警

值得快速浏览而非精读。核心亮点有两个:一是用 message 子串匹配的 Filter 而非粗暴压制整个 logger 级别,体现了'最小必要抑制'的日志治理原则,这个模式可以复用到其他依赖库的告警清理;二是把全局抑制提前到 gpu_worker 模块导入期并配合 spawn 子进程的 import 时序,属于容易被忽视的进程模型细节。若团队经常排查 diffusion 启动日志,建议合并后观察一段时间确认无其他依赖告警被误伤。

功能 重要性 7.78 洞察度 6.00

支持 MiniMax H3 原生与 PEFT 双格式 LoRA

值得精读。三个设计点有借鉴价值:_compute_lora_delta 用 einsum + flatten 统一 2D/3D 投影;param_names_mapping 用 (目标名, 偏移, 组数) 三元组表达 QKV 堆叠契约;alpha 解析采用“显式参数 > adapter_config.json > 默认回退”的三级策略并支持运行时更新。建议关注后续对 lora_param_names_mapping 旧字段的清理,以及 stacked 3D 在 TP 下的切片验证。

基础设施 重要性 8.25 洞察度 6.00

升级 FlashInfer 至 0.6.17,移除 Kimi K3 的 cubin pool 与 DCP 补丁

值得精读。这是"上游能力成熟后系统性清理下游 workaround"的样板 PR:以依赖升级为切入点,跨 kernels/srt/docker/ci/docs 五个层面联动删除,并用 E2E rerun 闭环验证。重点阅读 `mxfp4.py` 的官方 API 迁移方式(枚举替换魔法数字、元组返回值处理、`tune_max_num_tokens` 的引入)和 `overrides.py` 的默认策略简化;值得借鉴的是"显式版本门槛 + 删除即验证"的节奏。可关注的点:删除 6000+ 行后单元测试覆盖偏薄,数值等价性主要依赖 B300 E2E,后续若条件允许可补充针对官方 API 签名的契约测试。

功能 重要性 7.50 洞察度 5.00

支持 GLM-4.7-Flash 在 Blackwell 上确定性 FA4 推理

值得精读。核心看点:确定性推理与 batch-size 相关 kernel(cutedsl)冲突时的处理范式——既在 auto 路径自动规避,又对显式选择直接报错;测试基类用类身份取代参数探测来判定抽象基类,是易被忽略的整洁改动。

参与讨论