Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 20:51 同步状态:空闲 下次计划:2026-09-02 21:51

PR 列表

更多筛选
2026-07-03
功能 重要性 8.87 洞察度 7.00

为 Ideogram 4 添加 Cache-DiT 加速支持

值得精读。该 PR 展示了如何通过基类抽象方法为不同模型扩展通用优化技术,评审中关于去重、SCM 修复和抽象化的讨论提供了实际工程权衡。

缺陷修复 重要性 5.24 洞察度 4.00

热补丁修复 AMD 镜像 transformers 符号链接 bug

该 PR 是典型的临时热修复,适合快速合入以解除 AMD 部署阻塞。建议精读 hot-patch 的实现方式,特别是其自跳过和断言保护模式,可作为同类紧急修复的参考模板。

#30001 [NPU] bugfix for dsv4 memory pool

原始 PR · 作者 khalil2ji3mp6 · 合并时间 2026-07-03 16:41

缺陷修复 重要性 5.63 洞察度 3.00

为 NPU 添加空实现的 clear_unaccepted_c128_draft_states

值得快速合并以修复 NPU 兼容性。建议未来添加注释说明为何留空,方便后续维护。

#30018 [Fix] Turn off dsa indexer fusion by default

原始 PR · 作者 Fridge003 · 合并时间 2026-07-03 16:08

缺陷修复 重要性 4.53 洞察度 3.00

默认禁用 DSA indexer fusion 以避免流爆炸

建议阅读。本 PR 明确阐述了临时关闭特定功能的理由,体现了处理生产环境问题的务实态度。对于关注 DSA 后端或 DeepSeek 模型稳定性的团队,值得作为参考案例了解如何用环境变量控制风险功能。

功能 重要性 5.80 洞察度 6.00

XPU 使用 sgl-kernel 的 flash_mla_with_kvcache

值得精读,尤其是对于参与 XPU 或 DeepSeek V4 多平台支持的工程师。关注 XPU 上 sgl-kernel 的 flash_mla_with_kvcache 实现与 CUDA 版本的差异,建议进行准确度回归测试。此外,后续考虑统一分块逻辑到通用实现以减少重复代码。

功能 重要性 4.53 洞察度 3.00

为 fused_topk_torch_native 新增 sqrtsoftplus 评分函数

小型功能性 PR,逻辑清晰简单,但缺少单元测试覆盖,建议在后续整合中补充针对 `sqrtsoftplus` 的简单测试。值得关注的是 DeepSeek V4 模型对 MoE 评分函数的定制需求。

重构 重要性 8.54 洞察度 5.00

移除冗余XPU Graph后端并默认禁用

值得精读。本 PR 展示了在多硬件后端中如何安全地废弃旧实现、调整默认配置以及处理不同设备的 API 兼容性问题。`server_args.py` 中的 `_lock` 机制和 `_handle_xpu_backends` 的配置回退逻辑,是构建健壮配置系统的良好参考。同时,`mem_get_info` 的 try-except 模式值得在类似场景下复用。

参与讨论