新增 MiniMax H3 checkpoint 格式总表,整合量化 CLI 文档
值得查阅但不必读代码:使用 MiniMax-H3 或 SGLang-Diffusion 量化时,这份表格是最新的格式-CLI 对照;文档维护者可借鉴“来源驱动表格 + 单一事实源 + 锚点复用”的结构。合并前建议回看 Extra CI 失败,并抽查删除行是否覆盖了 GGUF 等细节。
SGLang is a high-performance serving framework for large language models and multimodal models.
新增 MiniMax H3 checkpoint 格式总表,整合量化 CLI 文档
值得查阅但不必读代码:使用 MiniMax-H3 或 SGLang-Diffusion 量化时,这份表格是最新的格式-CLI 对照;文档维护者可借鉴“来源驱动表格 + 单一事实源 + 锚点复用”的结构。合并前建议回看 Extra CI 失败,并抽查删除行是否覆盖了 GGUF 等细节。
请求级 CUDA 内存池限制图像预处理显存,修复 VLM VRAM 增长
值得精读。该 PR 用最小改动解决了 VLM 长跑服务中容易被忽略的显存保留问题,核心技巧是请求级 `torch.cuda.MemPool` 作用域化分配,适合迁移到其他存在临时显存需求的预处理/后处理链路。
支持 Nemotron 3.5 Lightning DFlash/DSpark 推测解码
值得精读。该 PR 展示了如何以低侵入方式将新模型接入现有推测解码框架,尤其是"从 checkpoint 配置派生布局行为、避免新增 ServerArgs 开关"的设计决策,以及用结构检查保护通用路径的做法。建议关注 `dspark_config.get_dspark_sample_from_anchor` 的兼容策略和 `dflash._logical_linear_weight_shape` 的 packed 权重处理。
新增 Kimi-K3 B300 MMMU-Pro 精度 CI 覆盖
值得精读,尤其关注 `run_eval.py` 中 preset 与 legacy 参数分支的设计,以及 `MMMUProMixin` 的阈值校准方法论。对后续为其他推理模型添加 sgl-eval 评测有直接参考价值,也展示了如何通过实测数据驱动 CI 阈值设定。
重构 HiCache 主机池管理,多池统一编排,净删 152 行
值得精读。重点学习 `HostPoolGroup` 的 anchor + sidecar 组合、`resolve_host_transfers` 的原子分配与 rollback、`packed_draft_device_pools` 对 MTP draft 传输的剥离,这些设计对后续新增池类型(更多模型状态、更复杂的 draft 方案)有直接指导意义。建议在合入后重点补跑 GPU 套件与 HiCache + draft 的端到端回归,确认删除的 legacy 路径没有隐性依赖。
新增 Spark3 模型架构支持与工具调用解析器
值得精读。面向模型接入开发者,重点看三处:`Spark3Config` 的 `layer_types` 与两套 `rope_parameters` 默认策略;`models/spark3.py` 的滑动窗口语义换算与 head-wise 输出门控实现;`Spark3Detector` 的流式原子输出与类型转换回退。建议在合并后跟进模型 E2E 精度测试与 1M context 压测。
修复分组释放时 SWA 槽位所有权竞态
值得精读,特别是 `free_swa` 和 `free_group_end` 的时序调整。
原始 PR · 作者 shikicloud · 合并时间 2026-08-26 05:55
启用 DSV4 flashinfer_mxfp4 共享专家融合,显著降低 TTFT 与 ITL
值得精读。这是一个"机制已存在、本 PR 负责启用与防护"的典型范例:源码改动极小(12 行 guard),但通过契约测试把量化 wire format 钉死,并通过 fail-fast 防护避免 EP 下静默错误。可重点关注 `uses_per_rank_fused_shared_slots()` 与 `_maybe_load_fp8_shared_expert_as_fp4` 的交互,以及测试中对 -0.0 编码的断言处理方式。
参与讨论