文档修复:补充 Laguna 模型远程代码信任参数
该 PR 为纯粹的文档修复,无需精读源码。值得注意的设计决策是:在 `laguna-m1.jsx` 中通过在每个 cell 的 `flags` 数组中加入参数,而非在全局配置中统一添加,保持了模块化但增加了维护成本。对于类似需要全局参数的场景,可考虑在 JSX 配置层抽象一个 'global flags' 机制来避免逐 cell 重复。
SGLang is a high-performance serving framework for large language models and multimodal models.
文档修复:补充 Laguna 模型远程代码信任参数
该 PR 为纯粹的文档修复,无需精读源码。值得注意的设计决策是:在 `laguna-m1.jsx` 中通过在每个 cell 的 `flags` 数组中加入参数,而非在全局配置中统一添加,保持了模块化但增加了维护成本。对于类似需要全局参数的场景,可考虑在 JSX 配置层抽象一个 'global flags' 机制来避免逐 cell 重复。
SM120 MXFP4 MoE 默认使用 Marlin 内核,删除 Triton 回退路径
值得精读。该 PR 展示了如何将 MXFP4 MoE 从手动编写 Triton 内核迁移到通用的 Marlin 后端,涉及数据格式转换、瓦片对齐和融合激活函数。关键设计决策包括:通过 `allow_tile_padding` 放松 Marlin 的形状要求,以及删除 SM120 专用的 warp 补丁。对 GPU kernel 优化和量化部署有借鉴意义。
原始 PR · 作者 kangwangamd · 合并时间 2026-06-19 10:18
放宽 AMD allreduce 融合精度测试容差
建议合并。该 PR 正确识别了 CI 失败的根因(Docker 镜像 aiter 版本落后),并通过合理的容差调整解决了问题。容差推导过程严谨,值得参考。
原始 PR · 作者 ntgiang71096 · 合并时间 2026-06-19 10:11
AMD 推测验证分块 KV 注意力,加速~11x
该 PR 值得精读,尤其关注:如何将成熟的 flash-decode 技术跨场景迁移、多层平台门控模式的运用、以及缓存 key 设计对显存稳定性的影响。对 TritonAttnBackend 中条件调度逻辑的封装方式值得后续类似扩展复用。
新增 CUDA-Graph 捕获跟踪导出功能
简单实用的调试增强,值得快速合入。设计上保持了最小侵入性(默认关闭),值得学习。
原始 PR · 作者 huangtingwei9988 · 合并时间 2026-06-19 09:48
支持混合池 staged H2D 写回 JIT 内核
建议阅读本 PR 以了解 HiCache 如何从单池 staged 扩展到混合池。关键设计点包括: 1. 将 staged module 与主 module 分离,降低编译依赖; 2. 通过 `can_use_write_back_jit` 标志解耦写回路径选择; 3. CPU 模拟测试框架(mock JIT 函数)值得复用。 对于 Mamba 精度回归,建议后续 PR 跟进确定性能差异根因或在 Mamba 池中回退到非 staged 路径。
移除MoE FP8量化中的冗余类型转换和拷贝
建议合并。这是一个小而明确的性能优化,经过精度验证(GSM8K)和 CI 测试,无风险。两个优化点(移除降级拷贝和 .contiguous())在 FP8/FP4 MoE 前向路径上直接减少了开销。对于理解 `per_token_group_quant_fp8` 接口和 MoE 推理优化有参考价值。
HTTP/2 支持多 tokenizer worker
该 PR 值得精读,尤其是 `_run_granian_server` 的两种模式设计、以及如何通过移除旧环境变量简化代码。设计决策关注:嵌入式 vs 多进程服务器在不同 tokenizer worker 数下的选择逻辑。
参与讨论