修复 DeepSeek-V4 MegaMoE 和 FakeKVManager 两处启动崩溃
建议合并。修改简洁、定位准确,已在 8×B200 上验证。MegaMoE 入口统一类型转换的设计比修复上游各路径更健壮。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 DeepSeek-V4 MegaMoE 和 FakeKVManager 两处启动崩溃
建议合并。修改简洁、定位准确,已在 8×B200 上验证。MegaMoE 入口统一类型转换的设计比修复上游各路径更健壮。
修复 Mistral-native EAGLE 草稿模型启动崩溃
值得快速合并,修复针对性强,改动极小且经过充分测试(GSM8K 精度回归测试通过、Gemma4 回归测试通过)。无需深入精读。
扩散模型逐层卸载泛化至所有组件
此 PR 是扩散模型离线推理显存优化的重要演进,值得精读。核心设计决策——通过组件名选择器泛化 layerwise offload、自动替换冲突 offload 标志——具有较高借鉴价值。建议关注点:layerwise_offload_components.py 中的分类与标准化设计、server_args.py 中的参数解析与冲突处理流程,以及 server_args_auto_tune.py 中的自动替换逻辑。
降低 GLM-5.1 FP8 测试内存比例至 0.85 修复 B200 OOM
该 PR 为一次小范围测试配置修复,无精读必要。但可关注其根因分析思路:B200 显存基线比 H200 高约 5 GiB,导致同样参数下 OOM。对所有 DP-attention 测试的 mem-fraction-static 统一管理值得借鉴。
废弃 dual MoE CUDA graph 双路捕获功能
建议关注 LoRA CUDA 图捕获的开发者仔细阅读此 PR。它展示了面对特性复杂化时的回退决策过程,以及在 Triton kernel 中利用早期退出实现零开销条件化的技巧。
为 PR Test workflow 设置差异化 run-name
值得快速合入。对于大型项目,CI 可观测性的小改进能显著提升效率。此 PR 的做法可作为其他 workflow 的参考模式。
修复测试集名称未同步导致 CI 崩溃
PR 内容简单,变更明确,可以直接合并。建议团队关注跨 PR 的命名同步问题,尤其在密集合并窗口期间,考虑引入自动化检查来校验测试集名称一致性。
三元表达式转为 if 语句
可直接合并,无需精读。
参与讨论