合并 NPU 测试修复:进程组收割与挂起检测
值得 NPU 测试维护者精读 run_bench_serving 的看门狗实现:把 'stdout 空转超时 + 排空宽限 + 进程组 SIGKILL' 组合起来管理长跑子进程,是一个可复用的测试进程治理模式。一般开发者可略读,只需关注 DEEPEP_HCCL_BUFFSIZE 这类环境变量约定是否与本仓库 NPU 部署文档一致。
SGLang is a high-performance serving framework for large language models and multimodal models.
合并 NPU 测试修复:进程组收割与挂起检测
值得 NPU 测试维护者精读 run_bench_serving 的看门狗实现:把 'stdout 空转超时 + 排空宽限 + 进程组 SIGKILL' 组合起来管理长跑子进程,是一个可复用的测试进程治理模式。一般开发者可略读,只需关注 DEEPEP_HCCL_BUFFSIZE 这类环境变量约定是否与本仓库 NPU 部署文档一致。
原始 PR · 作者 AliceChenyy · 合并时间 2026-08-25 08:42
SM120 flash_mla 分页缓冲改在推断模式外分配
值得精读,但仅面向关注 SM120 内核和 CUDA graph 相关机制的工程师。核心设计决策是保持惰性缓冲区分配与使用模式一致性,并修复不对称保护。可借鉴其注释说明写法,但实现简单,无需深度分析。
原始 PR · 作者 huangtingwei9988 · 合并时间 2026-08-25 08:29
新增多步 HiSparse swap 内核,一次 gather/commit 完成 MTP 交换
值得精读。本 PR 展示了如何通过双内核 + PDL 设计将多步交换合并为一次启动,并包含跨步骤去重与近似缓存接纳的权衡,对推理引擎开发者有参考价值。同时需关注其后续集成进展与边界测试补强。
预过滤并延迟解析,让棘轮测试提速 2.4 倍
**值得精读**,尽管它只是一个测试优化 PR,但体现了很好的性能分析方法论:精准定位热点(量化耗时分布)、通过最小改动消除 O(n²) 开销、用自校验确保正确性。对于 CI 维护者,可作为后续优化其他慢测试的参考模板。对于普通开发者,可以学习 `get_source_segment` 的性能陷阱和预过滤模式的通用价值。
原始 PR · 作者 alphabetc1 · 合并时间 2026-08-25 07:05
修复 MiniCPM-SALA 配置读取对解析棘轮不可见的问题
该 PR 值得精读,因为展示了如何通过调整配置写入与读取方式来满足静态可分析性测试的要求,以及如何配套调整测试发布调度上下文。重点关注 `overrides.py` 中从循环到字面量键的重构思路,以及 `backend.py` 中统一读取路径的实践。
原始 PR · 作者 BJWang-ant · 合并时间 2026-08-25 05:49
新增 PD 稳态吞吐基准模式,不改共享 serving 代码
中等优先级,值得精读。重点关注三点:一是零侵入集成模式——用 `inspect.signature().bind()` 包装 `serving.calculate_metrics` 采集数据而不改共享代码;二是事件扫描式稳态窗口算法与确定性 tie-break;三是基于 TTFT/ITL 的输出吞吐近似估算及其明确的局限性。对维护 `sglang.benchmark` 或做 PD 压测评估的工程师有直接参考价值。
原始 PR · 作者 AMD-yanfeiwang · 合并时间 2026-08-25 05:43
MORI 下仅 CP rank 0 发送复制状态,传输流量降 85%
值得快速浏览:整体改动仅 4 个文件、71 行,核心是 `_should_skip_cp_replicated_state_transfer()` 的策略上移与 MORI `send()` 的去重接入。对从事 PD 传输或 AMD 后端的工程师,公共策略 + layer split 例外的设计值得借鉴;普通使用者无需深入。若后续要在 MORI/Mooncake 之外的新后端复用,注意其前提是「CP all-gather 后 state 全等」。
修复 Qwen3.5 MTP 丢弃融合共享专家权重的问题
值得精读,该 PR 展示了如何处理共享专家融合带来的权重布局变化,以及如何保持与主模型逻辑的一致性。关注其对 `qwen3_5.py` 的镜像逻辑和未来可能需要的扩展。
参与讨论