Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 02:24 同步状态:空闲 下次计划:2026-09-03 03:24

PR 列表

更多筛选
2026-06-18

#28546 [diffusion] Fix FP8 fused TP scale loading

原始 PR · 作者 mickqian · 合并时间 2026-06-18 14:38

缺陷修复 重要性 7.04 洞察度 6.00

修复融合 FP8 per-tensor scale 在 TP 下加载错误

值得精读,特别是权重加载器处理特殊参数(`PerTensorScaleParameter`)的设计模式。为类似量化参数的加载提供了可参考的标量广播实现。

基础设施 重要性 5.02 洞察度 4.00

新增AMD CI extra-a 1-gpu-large测试层

该PR展示了良好的CI分层设计:将测试按硬件平台和资源需求分层,并通过标签控制触发。其跨平台测试注册方式(register_cuda_ci / register_amd_ci)值得其他后端参考。建议关注后续可能将更多通过验证的测试从CUDA extra-a移植到AMD。

测试 重要性 4.10 洞察度 3.00

为 AMD CI 注册 3 个 JIT 单元测试

值得快速合入。该 PR 本身是增量改进,但背后的测试分层和跨平台注册模式值得关注:通过 `register_amd_ci` 和 `register_cuda_ci` 统一管理 CI 注册,降低维护成本。

功能 重要性 8.44 洞察度 5.00

实现分块预填充中止与PD对端存活检测

值得精读,特别是 `process_pending_chunked_abort` 的安全中止模式(延迟处理+多个调度点)和 `resolve_waiting_queue_bootstrap` 的对端检测集成方式。测试代码也提供了良好的端到端验证范例。建议熟悉 scheduler 和 PD 模块的团队成员优先 Review。

缺陷修复 重要性 5.52 洞察度 3.00

修复 Laguna 在 sliding_window=0 时错误启用 hybrid-SWA

值得合并。该 PR 修复了一个影响 Laguna 模型在无滑动窗口下运行的 bug,逻辑清晰,风险低。建议阅读 `is_hybrid_swa_model` 中的新增判断和 `laguna.py` 中默认层类型的变更,以确保理解 hybrid-SWA 识别的边界条件。

缺陷修复 重要性 3.78 洞察度 3.00

升级 XPU 平台 diffusers 依赖版本

1. **精简有效**:PR 直接命中问题根因而改动最小,review 后及时移除了不需要的 apache-tvm-ffi 依赖,可快速合入。 2. **值得精读**:对于其他平台维护者,可参考此 PR 的逻辑,将 diffusers 升级同步到对应的 pyproject 文件中。 3. **设计决策**:保持了 XPU 平台的独立配置,未盲目同步到所有平台,体现了谨慎的变更策略。

文档 重要性 5.09 洞察度 2.00

更新Kimi部署文档,tokenspeed MLA时必须设置fp8 KV cache

简单直接的文档修复,逻辑清晰。建议后续在文档相关变更中同样关注代码片段与实际后端参数规则的同步。

参与讨论