Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 19:08 同步状态:空闲 下次计划:2026-09-01 20:08

PR 列表

更多筛选
2026-08-10
测试 重要性 4.40 洞察度 4.00

AMD CI 新增 3 个嵌套单元测试,修复 3 处测试 stub 缺口

值得关注 `gpu_cases.py` 中 `_discover_unit_tests()` 的 HIP 分支设计,这是"同一套测试在不同硬件车道差异化收集"的可复用方案:对生产代码零侵入、对 CUDA 车道零影响。若只关心功能开发,可快速浏览 PR body 的测试结果表;若要扩展 AMD CI 覆盖,建议精读本 PR 与 #31483 的配套改动。

功能 重要性 9.00 洞察度 7.00

异步导出 OTel 追踪:ZMQ 子进程消解热路径开销

值得精读 `trace_async.py`(进程外重放架构、线程安全 socket、TTL 上下文回收)与 `trace.py` 的 `preset_next_span_id` 机制。重点关注三个设计点:一是"调用方预生成 span ID + exporter 一次性消费"如何在不动 OTel `start_span` API 的前提下保持 span 树一致;二是 flush 时机选择在 `process_batch_result` 的 CPU/GPU 重叠点而非固定定时器,属于零成本重叠的典型做法;三是环境变量统一收敛到 `envs`、双轨选择集中到 `req_time_stats.init_trace_ctx` 的接入方式,把对业务代码的侵入降到最低。

#33661 [BCG][5/N] MLA Fully Support

原始 PR · 作者 Oasis-Git · 合并时间 2026-08-10 14:52

功能 重要性 7.69 洞察度 6.00

BCG 全量支持 MLA:移除禁用规则,修复捕获期缺陷

值得精读。核心看点:一是三个架构代理标志收敛为 `is_cuda()` 平台不变量的契约演进方式;二是三个捕获期缺陷(trtllm_mla 形状断言、qv 核 split-KV、dispose_tensor 释放)的根因定位逻辑;三是「拆分只是并行化策略,单 split 永远正确」的保守修复策略。建议结合 commit message 阅读,比 PR body 信息量大得多。

修复 FlashInfer SWA 漏传 FP8 scale,SM120 开启 fp8 autotune

值得精读 `flashinfer_backend.py` 的修复模式——同一 wrapper 对象多处调用的一致性排查方法,以及 `flashinfer_autotune.py` 中「按硬件能力判断而非架构白名单」的思路。对在 Blackwell 上部署 FP8 KV cache + 滑动窗口模型的团队有直接意义;MLX 注释清理部分可略读。建议后续为 `forward_return_lse` 的 scale 传递补充一条针对 FP8 + SWA 的回归测试,并把 `test_fused_fp8_kv_write.py` 注册进 CI。

功能 重要性 8.52 洞察度 5.00

新增 NVFP4 token embedding 支持,gather 时解量化

值得精读,尤其是 get_quant_method 分支顺序约束和 gather 时解量化的实现;对要支持 NVFP4 embedding checkpoint 的部署团队有直接价值。测试的独立 oracle 写法(逐元素循环避免镜像实现)也是可借鉴的验证模式。注意本 PR 没有 review 讨论,设计决策主要记录在 PR body 中,阅读时应一并参考。

功能 重要性 6.90 洞察度 6.00

MiniMax M3 启用 TRT-LLM MoE 后端,保留 SwiGLU 参数

值得精读。该 PR 是一个典型的"模型新后端使能"案例:核心设计决策是把模型级标量配置在权重加载阶段物化为 per-expert 张量,再通过 `MoeQuantInfo` 数据契约透传到 custom op wrapper,这种"整数/浮点配置到张量参数"的物化模式在多个 MoE 后端间可复用。同时应关注两个后续风险点:fp8_utils 的 cute-dsl 路由需要补充 SM120 防护,以及移除 autotune workaround 后的长尾硬件验证。建议合入后跟进毫米波的后续 `--fp8-gemm-backend=flashinfer_cutedsl` PR,把这次的小 M 路由逻辑统一收口。

功能 重要性 9.36 洞察度 9.00

MLX 后端窗口化 SWA KV 存储并新增图内采样

值得精读。这是 MLX 后端迄今最重要的 PR 之一,建议重点关注三个设计决策: 1. **图内 Gumbel-max 采样如何与 overlap 调度器共存**——chaining 属性保住了 0.05-1.2 ms/step,而 body 诚实披露采样本身在 batch 64 时要 0.5-24 ms/step,这个取舍框架可以直接借鉴; 2. **SWA 前缀全量重算的取舍**——用精确性论证代替启发式优化,并明确标注"后续 SWARadixCache 恢复快速命中"的演进路径; 3. **bounded top-K 链与 murmur hash 移植**——把 CUDA 语义搬到 `mx` 平台时如何保持 seeded 行与 batch 组成无关的契约。 同时注意其性能数字都是低并发 Apple Silicon 本地 serving 场景,推广到高并发服务前需重新验证。

功能 重要性 5.11 洞察度 3.00

XPU 启用 DSV4 片形 MoE silu_and_mul_clamp 路径

值得快速浏览,作为 Intel GPU 支持 DeepSeek V4 系列的一部分了解平台适配方式,但不必精读。核心做法是用断言放开平台限制、复用已有融合内核,设计上简洁。值得关注的点是:为什么 HIP 仍被排除、以及 XPU 上的 silu_and_mul_clamp 内核是否已通过其他途径验证;建议后续补一个 XPU 上的精度回归测试。

参与讨论