Prhub

sgl-project/sglang · 标签视图

标签列表

聚合结果

cpu 相关 PR

2026-09-01
缺陷修复 重要性 4.47 洞察度 3.00

修复 Qwen3.5 MoE 单元测试因使用错误模拟方式导致的 Xeon CI 失败。

这是一个清晰、小规模且必要的测试修复 PR。它正确地解决了由前序 PR 引入的测试回归问题,且不涉及生产代码。对于维护 CI 健康和测试准确性很重要,但代码逻辑简单,**值得快速审阅**以确认修复的正确性,但不需要进行深入的代码逻辑分析。PR body 已充分解释了动机和修改,是一个良好的实践。

2026-08-31
缺陷修复 重要性 5.38 洞察度 4.00

修复 Qwen3.5 CPU GPTQ INT4 权重缺失

值得快速阅读:改动虽小,但揭示了 PyTorch 量化模块与 nn.Module.__getattr__ 的隐蔽交互,是“惰性求值中避免属性递归”的典型范例。关注点:(1) LazyValue 惰性判定与 and 短路的配合;(2) 直接检查 _parameters 以绕过属性兜底的写法及其代价(依赖内部契约)。建议后续为 CPU + GPTQ INT4 场景补充单元测试,防止该路径再次回归。

2026-08-29
缺陷修复 重要性 6.38 洞察度 5.00

修复 CPU 后端双向注意力被误加因果掩码

值得精读,尤其是内核 stage-2 循环中 `num_keys` 计算与掩码条件如何用一个 `is_causal` 布尔参数同时支持因果与双向两种模式,以及 C++ 内核与 Python 后端之间参数透传的完整链路(声明、schema 注册、backend 调用、测试接线)。该 PR 是理解 SGLang 后端抽象层如何对齐不同硬件实现(CPU AMX 与 Triton)的较好样例;如果你的团队维护 CPU 或注意力后端,建议同步关注测试覆盖缺口。

2026-08-28

#35677 fix(cpu): skip GPU JIT MoE top-k on CPU

原始 PR · 作者 xinguozhu-2026 · 合并时间 2026-08-28 17:31

缺陷修复 重要性 5.44 洞察度 4.00

CPU 跳过 GPU JIT MoE top-k,修复 CPU MoE 推理崩溃

值得快速阅读:这是一个典型「后端误入 GPU-only 路径」的最小修复范本,改动仅 6 行,评审讨论体现了支持边界的取舍。建议 CPU 维护者关注 review 中关于非 AMX CPU 支持范围的决策,并后续补充自动化测试与非 AMX CPU 性能评估。

2026-08-27
基础设施 重要性 4.68 洞察度 5.00

修复 XEON CI 失败:SPR 容器重构、缓存挂载、AMX 参数调整

值得 CI/基础设施维护者精读。重点学习:如何根据 sglang 的内存预留机制(psutil 读宿主内存、cgroup 不生效)推导出容器编排方案;以及 review 如何通过 "hiding the real dependency" 的判断把一次不正确的测试补丁拦截下来并最终回退。对 DeepSeek V4 共享专家融合逻辑感兴趣的人,可关注 get_parallel().override(moe_ep_size=1) 这个测试辅助模式的用法。

#35222 [CPU] Enable ERNIE models on CPU

原始 PR · 作者 ZailiWang · 合并时间 2026-08-27 10:13

功能 重要性 5.90 洞察度 4.00

CPU 后端启用 ERNIE 模型推理

建议精读。这个 PR 以极小 diff 解决“内核契约与权重格式不一致”的典型问题,并通过 review 展示了原地 vs 非原地张量操作的坑;值得关注的设计点是:把设备差异尽量收敛在 Python 层、让内核契约保持简单。合并前建议补一条针对 BF16 + 2D `correction_bias` 的单元测试。

缺陷修复 重要性 5.56 洞察度 4.00

修复 CPU 图捕获中 rotary 嵌入的布局错误

此 PR 是一个小而重要的 bugfix,值得精读以理解 fake 内核与真实内核的重要性。维护者应关注是否有测试覆盖此场景,但本次未能添加测试,因此建议后续补充 CPU 图捕获的回归测试,以覆盖不同布局的 rotary embedding。

缺陷修复 重要性 5.23 洞察度 5.00

修复 intel_amx 后端 spec verify 的 KV 前缀截断

该 PR 值得精读,尤其是对于理解 speculative decoding 中 KV 元数据传递与 kernel 前缀推导的机制。关键设计决策在于保留元数据预计算值,而非从 forward_batch 直接读取,这提示了在修改前需深入理解元数据与 kernel 的契约。此外,该 PR 也暴露了测试覆盖不足的隐患,读者可关注后续 #35881 的跟进。