CUDA图捕获后动态调整KV缓存池大小,减少内存浪费
推荐精读本PR,涉及底层CUDA VMM实现和KV池动态调整的设计权衡。对于大规模推理服务,可评估启用以提升内存效率。注意当前opt-in状态和HND槽计算争议,建议在非默认路径下充分验证后再默认开启。
SGLang is a high-performance serving framework for large language models and multimodal models.
CUDA图捕获后动态调整KV缓存池大小,减少内存浪费
推荐精读本PR,涉及底层CUDA VMM实现和KV池动态调整的设计权衡。对于大规模推理服务,可评估启用以提升内存效率。注意当前opt-in状态和HND槽计算争议,建议在非默认路径下充分验证后再默认开启。
新增 LongCat-2.0 FP8 部署 cookbook
值得阅读以了解 SGLang 配置驱动 cookbook 的模板结构。重点关注 `longcat-2.0.jsx` 中 cells 和 playgroundFeatures 的设计模式,可供其他模型 cookbook 参考。建议后续完善 MTP 说明和硬件验证。
为双 transformer Cache-DiT 添加声明式适配器规范
该 PR 属于典型的数据驱动重构,值得阅读以理解如何通过声明式配置替代条件分支,提升代码的可扩展性和可读性。
支持 LongCat 2.0 FP8 模型在 8x B300 上部署与推理
本 PR 的 ngram token table 跳过掩码设计和 DSA indexer head padding 技巧值得精读;建议后续补充端到端集成测试并监控 decode 性能。
NPU 文档更新,添加新模型和参数说明
此 PR 为常规文档维护,无需深入代码审查。但值得关注的是,NPU 平台对 Prefill 上下文并行(`--enable-prefill-cp`)的支持标志着该平台在长上下文场景下的优化进展,开发者可查阅相关参数使用文档。
为 NPU 平台添加 HCCL 预热支持
建议精读:该 PR 展示了如何以最小改动扩展硬件支持,值得关注 `_handle_nccl_pre_warm` 的通用适配模式。
修复 FlexKV 引入的两项 trunk 测试回归
建议快速合入以恢复 trunk CI。该 PR 体现了对代码规范(使用 `runtime_context` 而非遗留全局访问器)和测试隔离的重视,值得所有贡献者参考。
默认禁用 FA3 sparse mask 内核以减小 wheel 体积
变更安全且收益明确,值得快速合并。适合作为了解 sgl-kernel 编译系统的示例。
参与讨论