修复 Inkling tool 结果渲染图片报 400 错误
值得精读。核心设计点是"渲染器输出与 MM processor 媒体收割之间的占位符计数契约",这类隐式契约在推理服务里很容易被忽略,本 PR 用专门测试把它显式固化;同时展示了如何把特判分支收敛为复用统一解析逻辑。建议关注后续 Inkling 多模态链路(如 audio part)是否也有类似契约需要补齐。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 Inkling tool 结果渲染图片报 400 错误
值得精读。核心设计点是"渲染器输出与 MM processor 媒体收割之间的占位符计数契约",这类隐式契约在推理服务里很容易被忽略,本 PR 用专门测试把它显式固化;同时展示了如何把特判分支收敛为复用统一解析逻辑。建议关注后续 Inkling 多模态链路(如 audio part)是否也有类似契约需要补齐。
新增短卷积后端扩展点与注册表测试,重构默认路径
值得精读。核心设计是「用可覆盖方法 + 注册表谓词」提供扩展点而不改变默认行为,是插件化集成的良好范式。建议重点关注 `sconv.py` 中的方法抽取方式(参数收敛为 `precomputed` 上下文)以及 `LinearAttnModelSpec` 的兼容性设计(可选字段默认 `None`)。测试文件可作为数值一致性测试的参考模板。
为 K3 DSpark 新增 MLA 验证 Triton 内核,最高提速 2.42x
该 PR 值得精读,尤其是 `verify_mla.py` 中针对 MLA 结构做的两阶段并行设计和 GEMM 拆分技巧,是理解如何为特殊 attention 结构定制高性能 kernel 的极佳示例。关注点包括:共享 latent 头块复用、floor 分区策略、bf16 中间存储的权衡。同时建议关注后续扩展到 gfx1250/942 的计划,以及是否需要补充自动化测试。
共享专家融合决策改为按 runner 安装,修复 draft 污染
值得精读。这是一个典型的“把隐式跨模块副作用收敛为显式生命周期”的重构,设计决策包括:loader 单一安装点、per-runner 双子叶(ACTIVE + speculative)、类方法门控 + wrapper 委托、forward 期拒绝读取、以及用注册表遍历 + AST 扫描做防回归。建议重点阅读 `python/sglang/srt/layers/moe/utils.py` 与两个新测试文件,理解如何防止“加了新 wrapper 就悄悄丢掉禁用条件”这类问题。
清理 bag 迁移遗留的 get_server_args() 死绑定
值得快速浏览,重点看两点:一是 `topk.py` “调用有副作用、绑定是死代码”的区分,二是 closure-aware AST 扫描的死代码发现方法(先断言行内容再删除)。该 PR 可作为大规模机械清理 + 语义保留的参考范式;若团队后续还要继续清理 `get_server_args()` 残留,建议补一个针对 `_eplb_remap_enabled` 发布探测语义的回归测试。
删除 ServerArgs.derive,per-runner 配置改走构造参数
值得精读。这个 PR 是配置对象生命周期治理的关键一步,展示了如何通过"删除 API + 收紧测试"来消除一类系统性缺陷。建议重点关注三点:一是 `server_args_variant` 对 dataclass 字段与类属性双通道校验的设计(为什么允许覆盖 `use_mla_backend` 方法);二是 `override_server_args` 从 `derive` 迁移到 `_apply_fields` 时对未知字段 fail-loud 的处理;三是 SKILL.md 中文档与代码同步演进的 review 流程。对从事推理框架配置系统或长期维护公共 API 的团队有参考价值。
GLM-Image adaLN 链融合 Triton 内核,去噪提速 8.1%
值得精读。这是一个高质量的融合内核案例,展示了如何从 SASS 层面复现 aten 内核数值以保证 bit-exact 的完整方法论,包括 Welford 归约、inline PTX 倒数/rsqrt 近似、bf16 逐操作舍入以及运行时自校验回退机制。对于从事推理内核优化的工程师有直接借鉴价值,也体现了 diffusion 模型数值一致性的严格工程实践。
FLUX.1 融合调制与 RoPE 缓存,提速 3.5%/6.9%
值得精读。核心看三点:一是 bit-exact 融合方法论——逐算子舍入复现 + 显式阻止 FMA 收缩 + 守卫回退 + torch.compile 图内禁静默回退,可推广到任意 elementwise 链融合;二是 quality 分层 + mount/unmount 协议,这是仓库在 #28708 回退教训后沉淀的“近似加速落地”标准答案;三是 PR body 的数值论证格式(HBM pass 数、microbench 归因 vs 端到端实测、md5/PSNR 三件套),是高质量性能 PR 的范本。建议抽读 flux.py 的 _flux_modulate / _flux_norm_modulate 与 modulate_scale_shift.cuh 的 modulate_value。
参与讨论