Prhub

sgl-project/sglang · 标签视图

标签列表

聚合结果

xpu 相关 PR

2026-09-01
基础设施 重要性 7.08 洞察度 5.00

XPU 夜间测试新增 per-model 指标 JSONL 记录与健康看板

值得精读。核心看点:① opt-in 零影响设计——env var 默认 None、全仓库无调用方,配合 append-only 与吞错,把“记录”与“决策”彻底分离,这是 CI 可观测性改造的安全姿势;② 双级记录(model 级 rich records + file 级 fallback)与 `test_file` 去重机制,兼顾数据丰富度与覆盖率;③ workflow 中直接内嵌 Python 渲染 dashboard 的做法,优点是单文件自包含,缺点是难测试。如果想复刻该模式,建议至少补一条 jsonl schema 的自动化测试,并统一 env var 的访问方式(全部走 `Envs` descriptor)。

2026-08-31
测试 重要性 4.64 洞察度 3.00

将四个 XPU prefill-only 测试迁至夜间网格并去掉显存门槛

不推荐精读,这是一次标准的 CI 网格分层调整,但有两个值得留意的实践:一是把"显存门槛"与"运行器规格"绑定而不是绑定到测试本身,迁移套件时门槛随之失效;二是用 `nightly=True` 显式区分触发频率,避免后续维护者误以为用例仍在 PR gate 上。对负责 XPU/Intel CI 的工程师可快速浏览。

#36422 add suffix for xpu kernel upload space

原始 PR · 作者 ZailiWang · 合并时间 2026-08-31 13:41

基础设施 重要性 4.06 洞察度 3.00

XPU kernel 发布独立到 +xpu 标签空间

该 PR 体量小、逻辑直白,适合快速浏览,可作为发布基础设施命名空间隔离的参考。值得关注的设计点:把后缀设计成带默认值的参数透传,使 CUDA/ROCm/MUSA 行为零变化,同时为后续后端扩展留了口子;但两处 tag 拼接分散在 workflow 与脚本中,建议后续抽成单一配置源,并补充 URL 生成的单元测试。

基础设施 重要性 3.03 洞察度 3.00

为 XPU Docker 镜像预装 Rust 工具链与 protobuf 编译器

值得快速浏览(diff 很小)。关注点有两个:一是 XPU CI 通过预构建镜像预装工具链、与后续变更解耦的策略,可作为"为依赖工具链的 PR 准备 CI 镜像"的典型先例;二是 rustup 未锁版本的问题,建议维护者评估是否需要固定工具链版本以保障构建可复现性。

2026-08-28
缺陷修复 重要性 6.08 洞察度 3.00

XPU 上延迟导入 tvm_ffi 相关 all_reduce 内核,修复 MiniMax M2 模型加载崩溃

该 PR 简单且低风险,值得快速合并。不建议精读,但可关注 XPU 平台支持的类似模式,作为后续其他模型在 XPU 上兼容性修复的参考。

缺陷修复 重要性 6.14 洞察度 5.00

延迟 sgl_kernel.quantization 导入,修复 XPU/ROCm/NPU 启动崩溃

建议精读。核心价值有三:一是延迟导入作为"设备专用内核"的标准处理范式,与 `gguf.py` guard 形成了可复用的兼容性约定;二是 `HFRunner` 进程回收的 join/kill 两级兜底,是测试基建中处理子进程持有设备资源的典型修复;三是 review 过程展示了"优先复用现有工具(`empty_gpu_cache`)而非新造 helper"的维护哲学。对负责多平台(XPU/ROCm/NPU)支持和 CI 稳定性的工程师尤其值得参考。

2026-08-27

#34492 XPU: remove SGLANG_USE_SGL_XPU flag

原始 PR · 作者 Xia-Weiwen · 合并时间 2026-08-27 17:38

重构 重要性 7.04 洞察度 5.00

移除 XPU 开关,默认启用 sgl-kernel MoE,可参数回退

值得精读。关注三个设计决策:一是「环境变量开关 → server args 显式后端」的配置收敛模式,可复用到其他平台的类似开关清理;二是双路径并存的分支写法 `is_xpu() and not get_moe_runner_backend().is_triton()`,在保持默认高性能的同时保留逃生通道;三是参数化测试对后端优先级矩阵的覆盖方式(server 参数优先于 layer 参数),可作同类后端选择测试的参考模板。

基础设施 重要性 6.47 洞察度 5.00

XPU CI 新增 multimodal_gen 触发与 24 GiB 适配扩散套件

值得精读,重点看 gpu_cases.py 中"平台能力差异驱动的测试分层":如何按显存预算从共享用例池中裁剪平台子集、如何用 `_select_xpu_cases` 避免用例定义漂移、为何必须原地 mutate `ONE_GPU_CASES` 才能让 pytest 参数化生效。对 CI 维护者而言,路径过滤器与 pr-gate 的 `changes_exist` 兜底设计、perf baseline 播种流程都可直接借鉴。若关注 XPU 扩散推理,denoising.py 的 None vs [] 修复也是 diffusers 集成的一个典型坑。