Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-04 03:57 同步状态:空闲 下次计划:2026-09-04 04:57

PR 列表

更多筛选
2026-06-08

渐进分辨率扩散加速,支持5种模型最高2.32×加速

值得精读。核心设计模式(钩子基类 + 路由器)适合作为框架功能扩展的范本。DCT 上采样和贝叶斯最优转换的数学实现具有参考价值。建议关注频谱系数拟合流程和 Wan 视频的对齐逻辑,这两处最有可能需要根据实际场景调整。

#27554 [UnifiedTree]: Support hicache metrics

原始 PR · 作者 hzh0425 · 合并时间 2026-06-08 20:18

功能 重要性 6.05 洞察度 4.00

UnifiedTree 支持 HiCache 指标收集

值得精读 `load_back` 方法的埋点方式,可作为其他关键路径添加可观测性的参考。但需注意 `get_global_server_args()` 的潜在异常,建议后续修复。

#27542 [EPD] Dynamic encoder registration cleanup

原始 PR · 作者 ShangmingCai · 合并时间 2026-06-08 19:08

缺陷修复 重要性 6.48 洞察度 5.00

修复EPD动态编码器注册中的URL环回和竞态bug

推荐精读,特别是encode_receiver.py中_consecutive_failures清理位置的调整,是一个典型的微调修复经典竞态案例。值得关注的还有atexit.register在uvicorn.run前的使用模式,可作为服务优雅关闭的参考。建议作者考虑gemini-code-assist的review建议,增强IP检测失败时的错误处理,并补充单元测试。

#26786 [GPTQ] Refactor CPU quantization schemes

原始 PR · 作者 Alisehen · 合并时间 2026-06-08 18:14

重构 重要性 9.00 洞察度 6.00

重构GPTQ CPU量化方案,拆分内核与scheme并迁移目录

该 PR 是量化模块归档重构的典型范例,值得量化子系统开发人员精读。重点关注 `_init_kernel` 工厂模式如何实现平台解耦,以及如何在保持现有 API 不变的情况下重组目录。后续新增 CPU 量化方案应遵循 `hardware_backend/cpu/quantization` 放内核、`layers/quantization/<algo>/schemes` 放 scheme 的约定。

功能 重要性 8.88 洞察度 5.00

为AMD ROCm添加FlyDSL融合归一化核,优化扩散模型

建议精读此PR,尤其是`fused_residual_norm.py`中FlyDSL核的实现和寄存器缓存优化技术,以及`layernorm.py`中多级fallback的设计模式,值得在跨平台多后端开发中参考。

缺陷修复 重要性 6.11 洞察度 5.00

修复 EAGLE spec-v2 draft-extend CUDA Graph 中 qo_indptr stride 错误

值得精读。该 PR 展示了一种典型的 CUDA Graph 元数据布局 Bug:indptr stride 与运行时 token 布局不一致,且容易漏掉 downstream 的 max_extend_len 同步修复。对于维护 spec-v2 或其他 CUDA Graph 元数据构建的开发者有参考价值。

重构 重要性 7.38 洞察度 3.00

降低传播KV传输失败日志等级至调试级别

PR设计简洁有效,降低了生产噪音,同时保留了原始失败信息。建议关注异常类型变更对第三方扩展的影响,并未来考虑添加单元测试覆盖传播检测逻辑。

基础设施 重要性 4.72 洞察度 4.00

CI 中动态重装 MoRI 以匹配 Dockerfile 版本

该 PR 是基础设施层面的维护,值得关注其解决特定 CI 问题的方法:在不可变 CI 镜像中动态替换预装组件以匹配当前代码。对于维护 CI 管线的工程师,可借鉴其模式。一般工程师无需深入阅读。

参与讨论