Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 17:58 同步状态:空闲 下次计划:2026-09-01 18:58
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-08-10
性能优化 重要性 6.37 洞察度 5.00

PD prefill 服务器跳过 spec verify 相关分配

值得精读,尤其是理解复用 draft-head 先例实现显存优化的设计思路。建议后续补充针对 PD prefill 模式的单元测试,覆盖 pool 分配、graph 捕获和 warmup 逻辑。

缺陷修复 重要性 6.26 洞察度 6.00

修复 SM10X 上 MiniMax-M2 NVFP4 的 MoE 后端路由

值得阅读,作为“窄范围修复 + 后端决策前移”的样例。重点看两点:一是如何通过模型级 override 而非全局 fallback 控制爆炸半径;二是 review 中关于 A2A 组合与静默损坏验证的讨论,这些是同类改动容易遗漏的坑。若团队后续在 SM100 上推进 MiniMax 系列,建议先补齐 deepep 组合的显式处理与 #26324 的正确性 probe。

测试 重要性 3.37 洞察度 3.00

NPU GSM8K 精度测试重试增至 3 次并放宽超时

该 PR 值得快速浏览,不建议精读——它只涉及测试工具与 CI 配置,无运行时逻辑。值得关注的设计点是:用全局 `MAX_RETRY_COUNT` 取代各测试基类的 `max_attempts` 属性,是"单一事实来源"的合理收敛;但 `DATASET_FLUCTUATION` 与 `DATASET_QUESTION_COUNTS` 不同步登记 `gsm8k` 的问题需要后续跟进,否则新增配置形同虚设。对负责 NPU/CI 稳定性的同学,建议顺带检查 `get_max_retries` 的完整实现,确认 GSM8K 重试确实达到 3。

性能优化 重要性 5.49 洞察度 6.00

c128 核 epilogue 改 2 warp 写回,提速 5%~10%

值得精读,尤其面向 kernel 工程师:① “最少参与 warp 数 + 寄存器折叠”的 epilogue 设计思路可迁移到其他归约密集型核;② 常量收敛为 Config / Trait 的写法是 JIT 多核共存的良好实践;③ 三次 rebase 合流评论是长生命周期内核 PR 如何与 dtype 重构共存的实例。注意点:合入时 CI 并非全绿、且无新增持久化测试,若要在生产环境依赖该 kernel,建议先自行跑 test_c128_v2.py 与 DSV4 精度回归再升级。

缺陷修复 重要性 5.21 洞察度 8.00

修复 DSV4 top-k 在 CUDA 13.1+ 丢非 primary rank 输出

值得精读。这是少见的“工具链版本敏感型编译器错误”调试案例:作者系统排除 9 类假设、用 slot-diff 与插桩把根因定位到单一指针变量携带两个地址空间,方法论本身有很高的迁移价值;`__builtin_assume` 作为 load-bearing 约束而非优化提示的用法也值得记录。建议阅读时重点关注 topk_impl.cuh 中两条散射路径的拆分注释、topk_v2.cuh 中 `__builtin_assume` 的依赖说明,以及 v1 模块 `STB_GNU_UNIQUE` 符号合并的分析。后续可跟进 sm_100a 运行时验证与 CI nvcc 版本保护。

性能优化 重要性 6.78 洞察度 4.00

speed 模式默认关闭 torch.compile,改为模型 opt-in

值得精读,尤其适合 diffusion 服务维护者。该 PR 是一个小体量但影响全局默认策略的变更:以 E2E 数据推翻「speed 即 compile」的直觉假设,并保留三层优先级(显式参数 > 模型部署配置 > 全局默认)。建议关注 `adjust_based_on_performance_mode` 中「模型 opt-in 且用户未显式传参」的生效条件,以及后续模型逐渐补齐 opt-in 的演进方向。

缺陷修复 重要性 6.99 洞察度 5.00

修复 DCP prefill 的 GQA 映射错乱,GSM8K 恢复至 0.95

值得精读。重点关注 `_forward_extend_dcp` 中 K/V 切片公式的简洁推导(`rank_in_group * tp_k_head_num // world_size` 配合 `max(..., start + 1)` 防空切片),以及 CPU 回归测试用 `FakeDcpGroup` + fake `extend_attention_fwd` 固定“无通信、形状正确、选区正确”三个契约的轻量测试模式。该 PR 也提供了一个很好的静默正确性回归修复范例:作者用精确的精度数据(0.77 vs 0.95)证明 bug、用 DCP1 对照证明无回归、用 TP8/DCP2 扩展拓扑覆盖。

LTX-2 新增 quality=high 融合核,去噪提速 5.7% 逼近 torch.compile

值得精读,三个看点:(1)profiling 归因方法——用 kernel-time 归因定位 torch.compile 优势全部来自 elementwise 融合,从而避免盲目上 CUDA graph,方法论可直接复用于其他 compute-bound 模型;(2)quality 门控的精度工程——显式承认 ≤ 1 ULP 差异,用质量档位而非运行时自检管理精度边界,lossless 默认保持 bit-exact;(3)复用与缓存——ones 权重缓存让 weightless RMSNorm 直接复用既有 `fused_rmsnorm_scale_shift_bitexact` 内核。建议后续将 PSNR 验收固化为 e2e CI 测试,并为 QualityGatedFusion handler 家族补充文档。

参与讨论