Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-05 02:29 同步状态:空闲 下次计划:2026-09-05 03:29

PR 列表

更多筛选
2026-07-16
缺陷修复 重要性 7.52 洞察度 5.00

修复 DeepSeek MLA 在 MI355 上 triton 后端的 null-K 故障与精度错误

建议仔细阅读 `_dispatch_mla_subtype` 和 `_skip_rope_for_aiter_fused_mla` 的改动,理解如何通过 backend 标识隔离专有路径。Hermetic 测试的设计(无 GPU 依赖、Mock 关键属性)值得在其他类似场景推广。该 PR 也暴露了项目中 env var 和 backend 选择不一致的架构问题,值得团队后续系统性解决。

缺陷修复 重要性 8.57 洞察度 6.00

修复 MiMo-V2 在 Blackwell 上的 FA3 回退与 TP 音频权重加载

建议团队精读此 PR,尤其是关注如何使用统一的 `VisionAttention` 接口解决硬件后端选择问题,以及如何在 `load_weights` 中处理 TP 下的权重重映射。这些设计模式对后续支持新模型或新硬件具有参考价值。

#30976 fix: load the right mtp lm head quantization

原始 PR · 作者 shaunkotek · 合并时间 2026-07-16 03:12

缺陷修复 重要性 6.46 洞察度 3.00

修复Nemotron MTP模型量化lm head加载

建议合并。变更简洁且修复明确,属于关键bug修复。可鼓励贡献者为类似场景补充测试。

修复异构TP分离下GDN conv状态切片和GQA头映射错误

此 PR 值得仔细阅读,特别是 `compute_mamba_state_slice_blocks` 的设计方式:通过元数据将“头部独立分片”抽象出来,并统一处理 scatter/aggregation 两种方向。这种模式可复用于其他非线性状态传输。测试用例可选作模型验证的参考。

#31360 Add Inkling cookbook

原始 PR · 作者 yhyang201 · 合并时间 2026-07-16 02:24

文档 重要性 6.98 洞察度 2.00

新增 Inkling 模型部署文档

作为标准 cookbook 添加,无特殊设计决策。可快速合并,未来需要补充基准测试数据和验证更多硬件平台。

参与讨论