Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 20:16 同步状态:空闲 下次计划:2026-09-01 21:16

PR 列表

更多筛选
2026-06-17
缺陷修复 重要性 6.02 洞察度 5.00

修复 ROCm 上 kernel write-back 崩溃

建议精读该 PR 以理解 HiCache 布局与 IO 后端之间的兼容性约束,以及跨平台(CUDA vs. ROCm)条件编译的典型模式。对于 AMD 平台开发者,这是一个值得关注的防御性修复案例。

缺陷修复 重要性 6.33 洞察度 5.00

修复 GLM-5 在 AMD GPU 上的精度问题

该 PR 改动小但定位精准,是典型的生产环境精度回退修复案例。值得关注的是其根因分析过程以及如何通过参数透传解决 kernel fusion 遗留问题。对于维护 AMD 后端的工程师有参考价值。

功能 重要性 8.59 洞察度 7.00

DeepSeek V4 压缩状态支持混合精度 (BF16)

值得精读,尤其是 CUDA kernel 中通过 `if constexpr (std::is_same_v<>)` 在编译期隔离两套加载策略的设计模式,既保证了新功能不退化旧路径,又保持了代码的可维护性。此外,使用模块级函数 `_get_dsv4_compress_state_dtypes` 集中解析环境变量,并在 `_apply_memory_pool_config` 中仅为 DSV4 模型调用,是一种清晰的运行时特性封装。

缺陷修复 重要性 5.08 洞察度 3.00

修复 Ascend NPU 注意力调度条件

建议合入。这是一个正确性提升的小修补,使调度条件与模型语义对齐,避免因实现细节变动而引入隐蔽的 bug。可作为代码健康性改进的示例。

性能优化 重要性 6.64 洞察度 6.00

EAGLE draft/draft-extend 拷贝批量化为 grouped foreach copy

值得精读,特别是对于需要优化 CUDA kernel launch 开销的开发人员。展示了如何通过批量小拷贝来减少 launch overhead,以及如何在 foreach 和 DMA 拷贝之间做性能权衡。方法通用,可推广到其他类似场景。

性能优化 重要性 6.11 洞察度 6.00

decode 阶段 H2D 拷贝改为异步

值得精读:这是一个小而精的优化案例,展示了理解 CUDA stream 语义和 overlap scheduler 后,如何通过一次 non-blocking 拷贝消除不必要的同步。对理解 SGLang 的 decode 调度路径也有帮助。

参与讨论