Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 20:51 同步状态:空闲 下次计划:2026-09-02 21:51

PR 列表

更多筛选
2026-08-25
测试 重要性 7.84 洞察度 4.00

迁移 prefill CP 测试到新策略参数,删除 v1 专用测试

值得精读,作为大型弃用流程中测试先行迁移的参考范式。关注点:1) 如何在删除旧测试的同时不失去回归保护(本 PR 依赖后续堆栈及时删除 runtime);2) 手动测试参数替换的等价性判断;3) 跨硬件 runner 的验证策略。对 CP 或 DeepSeek 相关测试维护者,这是一个理解新策略路径入口的窗口。

#33634 [NPU] Add test for --dllm-fdfo

原始 PR · 作者 longxin9715 · 合并时间 2026-08-25 10:58

测试 重要性 6.31 洞察度 4.00

新增 NPU 端 FDFO 调度性能回归测试

值得快速浏览而非精读。关注三点:NPU 测试的封装方式(`run_bench_serving`、`register_npu_ci`);长耗时测试如何通过 nightly 与 PR 套件划分来平衡 CI 开销与覆盖;以及用均值 TTFT、吞吐、P99 TTFT 三重指标交叉验证调度特性收益的断言写法。若要扩展,可考虑补充正确性对比和容差阈值。

性能优化 重要性 6.49 洞察度 6.00

DeepSeek V4 MHC 在 XPU 上改用 SYCL 内核,提速最高 3 倍

建议熟悉 DeepSeek V4 或关注 XPU/NPU 内核集成的工程师精读此 PR。值得关注的设计决策:1)用 `functools.cache` + 延迟导入避免模型注册表急切导入触发可选 CUDA runtime;2)用 NamedTuple 统一多后端内核句柄,调用方不感知硬件差异;3)fail-fast 优于 fallback,避免 CUDA-only 文件被跨后端逻辑污染。后续建议补充 XPU 端到端回归测试,并在文档中说明 `SGLANG_OPT_FUSE_MHC_POST_PRE` 的默认值与行为。

其他 重要性 3.27 洞察度 4.00

修正 test_dflash_logits.py 的 CI 预估耗时从 1s 至 35s

该 PR 为 CI 基础设施微调,值得快速浏览以了解分片预估机制;推荐作为 CI 配置维护的参考。

性能优化 重要性 6.56 洞察度 6.00

削减三个 CPU 测试的重复加载与串行子进程开销

值得精读。该 PR 展示了如何系统性地诊断 CI 性能瓶颈(逐个文件计时、区分根因、校准基线),并给出三个可复用的优化范式:lru_cache 消除重复对象构建、ThreadPoolExecutor 并行化独立子进程、字符串预过滤减少 AST 解析面。作者对每个优化都提供了实测数据、等价性论证和权衡说明,尤其对预过滤弱点和 -k 行为变化的坦诚披露,是写高质量 CI 优化 PR 的范例。关注 test_import_surface 预过滤后续是否被替换为更强方案,以及 base-c 测试是否跟进 tokenizer 共享。

性能优化 重要性 6.25 洞察度 6.00

8 个配置棘轮扫描测试加预过滤与缓存,CI 提速数倍

值得精读。核心价值不在功能交付,而在两个可复用模式:基于“字面标识符必然出现于源码文本”的预过滤,以及“输出等价断言 + 负对照注入”的验证方法。对 CI 维护者和静态分析型测试的作者很有借鉴意义;对只关心推理服务的工程师则优先级中等,因为不涉及任何运行时路径。实现中有两点值得学习:刻意不做过度收紧的边界判断,以及用负对照证明性能优化没有牺牲查全率。

功能 重要性 7.54 洞察度 5.00

新增组件级量化覆盖与忽略层配置

值得 diffusion 与量化方向的工程师精读:核心设计是「串行化检查点保持 metadata 驱动、在线量化用显式覆盖、不支持则 fail closed」这三条边界;`ServerArgs` 中 `_extract_component_quantization_ignored_layers` 与 `__post_init__` 的规范化/一致性校验模式也可作为新增组件级配置的参考范本。

功能 重要性 7.24 洞察度 5.00

实现 Comfy 混合 NVFP4/INT8 检查点按层分发量化

值得精读。set_comfy_layer_markers 展示了如何在一份量化配置内按层组合两种量化方法,get_quant_method 的 prefix 分发模式也可复用于其他混合量化检查点。注意本 PR 栈式叠加在 #36044 之上,建议结合父 PR 与 #36066 一起阅读,理解 Diffusion 量化加载的完整演进方向。

参与讨论