修复融合 FP8 per-tensor scale 在 TP 下加载错误
值得精读,特别是权重加载器处理特殊参数(`PerTensorScaleParameter`)的设计模式。为类似量化参数的加载提供了可参考的标量广播实现。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复融合 FP8 per-tensor scale 在 TP 下加载错误
值得精读,特别是权重加载器处理特殊参数(`PerTensorScaleParameter`)的设计模式。为类似量化参数的加载提供了可参考的标量广播实现。
原始 PR · 作者 michaelzhang-ai · 合并时间 2026-06-18 14:31
新增AMD CI extra-a 1-gpu-large测试层
该PR展示了良好的CI分层设计:将测试按硬件平台和资源需求分层,并通过标签控制触发。其跨平台测试注册方式(register_cuda_ci / register_amd_ci)值得其他后端参考。建议关注后续可能将更多通过验证的测试从CUDA extra-a移植到AMD。
原始 PR · 作者 michaelzhang-ai · 合并时间 2026-06-18 14:28
为 AMD CI 注册 3 个 JIT 单元测试
值得快速合入。该 PR 本身是增量改进,但背后的测试分层和跨平台注册模式值得关注:通过 `register_amd_ci` 和 `register_cuda_ci` 统一管理 CI 注册,降低维护成本。
DeepSeek-V4 压缩状态 dtype 文档说明
可直接合并。文档清晰实用,对使用 DeepSeek-V4 的用户有帮助。
实现分块预填充中止与PD对端存活检测
值得精读,特别是 `process_pending_chunked_abort` 的安全中止模式(延迟处理+多个调度点)和 `resolve_waiting_queue_bootstrap` 的对端检测集成方式。测试代码也提供了良好的端到端验证范例。建议熟悉 scheduler 和 PD 模块的团队成员优先 Review。
修复 Laguna 在 sliding_window=0 时错误启用 hybrid-SWA
值得合并。该 PR 修复了一个影响 Laguna 模型在无滑动窗口下运行的 bug,逻辑清晰,风险低。建议阅读 `is_hybrid_swa_model` 中的新增判断和 `laguna.py` 中默认层类型的变更,以确保理解 hybrid-SWA 识别的边界条件。
升级 XPU 平台 diffusers 依赖版本
1. **精简有效**:PR 直接命中问题根因而改动最小,review 后及时移除了不需要的 apache-tvm-ffi 依赖,可快速合入。 2. **值得精读**:对于其他平台维护者,可参考此 PR 的逻辑,将 diffusers 升级同步到对应的 pyproject 文件中。 3. **设计决策**:保持了 XPU 平台的独立配置,未盲目同步到所有平台,体现了谨慎的变更策略。
更新Kimi部署文档,tokenspeed MLA时必须设置fp8 KV cache
简单直接的文档修复,逻辑清晰。建议后续在文档相关变更中同样关注代码片段与实际后端参数规则的同步。
参与讨论