Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-06-16
性能优化 重要性 6.97 洞察度 5.00

Wan2.2 T2V A14B 编译模式改为 default,提升 5% 性能

值得阅读,尤其是在扩散模型性能调优和配置抽象方面。此 PR 展示了如何将实验性优化(#28050 中的 default 模式)平滑推广到更多模型,并同时建立可扩展的配置机制。建议关注 `_maybe_enable_torch_compile` 的参数透传模式及 DiTConfig 的字段设计。

功能 重要性 9.00 洞察度 6.00

新增上下文并行策略抽象层

值得精读,尤其是 `ContextParallelStrategy` 抽象基类和包组织结构。该设计为后续模型无关的 CP 分片打下基础,是 CP 重构的核心抽象。关注后续的 #27314 等 PR 以了解逐步填充的实现。

缺陷修复 重要性 4.17 洞察度 6.00

修复 AMD JIT 内核编译与测试注册

建议所有参与跨平台内核开发的团队精读该 PR。它不仅解决了一个实际的编译问题,还展示了如何在不污染 CUDA 代码库的前提下适配 AMD ROCm 平台。关键设计决策(如使用非 `#ifdef` 的类型别名统一返回类型、分离而非替换 CUDA reduce 实现)值得作为最佳实践推广。

#27088 [diffusion] Add precision consistency layer

原始 PR · 作者 jy-song-hub · 合并时间 2026-06-16 14:21

功能 重要性 9.10 洞察度 7.00

为 diffusion 引入统一的精度一致性层

建议精读,尤其是 `runtime/utils/precision.py` 的设计 —— 它提炼了扩散运行时中的共性精度模式(输入对齐、临时转换、autocast 策略),展示了如何用上下文管理器安全地临时修改模块 dtype。对于维护扩散相关模块的工程师,理解此层有助于避免未来 dtype 问题。此外,建议在后续 PR 中增加集成测试,验证各流水线在混合精度配置下的行为。

参与讨论