Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 20:51 同步状态:空闲 下次计划:2026-09-02 21:51

PR 列表

更多筛选
2026-06-27
缺陷修复 重要性 5.37 洞察度 4.00

修复 DSA CUDA Graph page_table 越界崩溃

建议审阅者重点关注:该修复对齐了 deepseek_v4_backend 的已有模式,但需确认 DSA 后端是否完全等价地处理 req_to_token 的额外列(尤其是 topk>1 或 page_size>1 场景)。

重构 重要性 9.11 洞察度 7.00

IPC 数据类迁移至 msgspec,支持可选 msgpack 传输

值得精读,特别是 PickleWrapper 的渐进迁移设计和 msgspec 与 pydantic 的桥接方式。开发者在涉及 IPC 数据类时,应遵循新的 msgspec.Struct 模式,并在新增传输路径时确保 wrap/unwrap 成对出现。建议后续 PR 逐步移除 PickleWrapper 和 pickle 默认值。

重构 重要性 9.18 洞察度 6.00

迁移 dsv3_router_gemm 到 JIT 内核,缩减 wheel 体积

值得精读。本 PR 是 AOT 到 JIT 迁移的完整范例,涵盖 CUDA 模板设计、Python 包装器、torch.compile 兼容、性能验证、测试覆盖。特别关注 RouterGemmDispatcher 减少编译模块数的优化,以及如何在不影响性能的前提下移除 AOT 依赖。

文档 重要性 4.42 洞察度 3.00

更新量化代码所有者并新增量化贡献指南

量化相关贡献者和维护者值得精读新增的量化贡献指南;CODEOWNERS 变更需要团队知晓并确认。建议在后续量化重构 PR 中引用该指南以保持一致性。

2026-06-26
缺陷修复 重要性 6.12 洞察度 5.00

MiniMax MSA: 修复 fmha_sm100_plan 缺失时的回退

值得关注其 fallback 设计模式:通过自定义异常类型(`MSAUnavailableError`)和一次性警告,实现优雅降级。这种包装第三方依赖错误的方式对其他后端(如 flash attention 不同版本)的可用性检查有参考价值。建议在类似场景中复用此模式。

#29390 [Diffusion] Fuse LTX2 Ada values

原始 PR · 作者 BBuf · 合并时间 2026-06-26 23:13

性能优化 重要性 8.71 洞察度 6.00

融合 LTX-2.3 Ada value 计算,端到端加速约 10%

值得精读。Triton 内核的编写方式(一次合并 9 个输出)和 fallback 模式(全局禁用标志+一次性异常抑制)是好的实践,可推广到类似计算模式。

#29147 [diffusion][perf]: Shard Qwen Text Embed in SP

原始 PR · 作者 avjves · 合并时间 2026-06-26 21:44

性能优化 重要性 8.14 洞察度 6.00

对 Qwen Image 文本嵌入进行序列并行分片,降低显存和 GEMM 计算,提速约 3%

值得合并。关键设计决策是将分片分为均匀和非均匀两条路径,避免强制填充带来的额外计算。建议在后续 PR 中考虑添加 `.contiguous()` 以增强鲁棒性,并补充单元测试覆盖边界条件。

基础设施 重要性 5.39 洞察度 3.00

新增 AMD MI350X 夜间测试 workflow

对于 CI 运维和 AMD 平台关注者,建议精读此工作流的镜像解析和矩阵策略设计,可作为类似硬件覆盖的模板。对于一般开发者,只需了解新的夜间测试流程存在即可,无需深入阅读。

参与讨论