融合 sigmoid 和类型转换到 append 内核
值得阅读。该 PR 展示了如何通过内核融合消除小内核启动开销,设计思路清晰,且通过条件编译确保 CUDA 路径不受影响。对于理解 AMD 共享专家融合路径的优化方向有参考价值。
SGLang is a high-performance serving framework for large language models and multimodal models.
融合 sigmoid 和类型转换到 append 内核
值得阅读。该 PR 展示了如何通过内核融合消除小内核启动开销,设计思路清晰,且通过条件编译确保 CUDA 路径不受影响。对于理解 AMD 共享专家融合路径的优化方向有参考价值。
原始 PR · 作者 yctseng0211 · 合并时间 2026-07-08 15:41
修复 AMD CI 流水线 stage-c 门控缺失
值得合并,逻辑清晰,改动小且经过 NVIDIA 工作流验证。可快速合入。
允许 cutedsl 使用 modelopt_mixed 量化
建议阅读 PR body 中对 `modelopt_mixed` 配置形状的分析,了解不同 ModelOpt 检查点的结构差异。此 PR 修改简洁,适合作为理解 SGLang 量化与 MoE 后端交互的入门案例。
回退导致 IMA 崩溃的 KV cache 池改动
建议审慎合入,后续应在修复 IMA 的根因后以正确方式重新实现 indexer 容量优化。同时建议补充针对 DSA 模型 + indexShare 场景的回归测试。
为扩散DiT模型启用Breakable CUDA Graph
该PR是扩散推理性能优化的关键里程碑,核心架构设计(BCG Runner + Prompt Padding)具有较高参考价值。建议团队阅读 `runner.py`、`breakable_cuda_graph.py` 和 `prompt_padding.py` 理解整体机制。未来添加新模型时务必参考已有padder实现,并在CI中添加对应BCG回归测试。
修复解码崩溃,清除 pending_reqs 并防御空 receiver
值得快速合入。修复明确且测试充分,使用 `id()` 进行身份比较的设计决策值得类似场景参考。
集中进程级资源单例到 ctx.resources,引入命名槽位和租约
该 PR 值得精读,尤其关注如何通过数据类 + _FlagGroupBase 将散落的运行时状态集中管理,并实现测试友好的 override 机制。对于构建大型推理引擎的资源管理层有很好的参考价值。
迁移 MoE/DP 运行时状态到类型化标志组
值得仔细阅读 runtime_context.py 和 test_module_state_ratchet.py,了解如何通过类型化标志组和 AST 回归测试管理运行时状态。这是清理遗留技术债的典范,类似模块(如 speculative decoding 中的状态)可借鉴此模式。
参与讨论