切换扩散 CI ground truth 数据源仓库
变更简单直接,但建议确认 sgl-project/ci-data 仓库已包含所需数据且 CI 测试通过。对于了解项目 CI 基础设施演进的读者有一定参考价值。
SGLang is a high-performance serving framework for large language models and multimodal models.
切换扩散 CI ground truth 数据源仓库
变更简单直接,但建议确认 sgl-project/ci-data 仓库已包含所需数据且 CI 测试通过。对于了解项目 CI 基础设施演进的读者有一定参考价值。
修复 StreamingSession 释放时 mamba 池泄露
建议合并。该 PR 修复了一个明确的资源泄露问题,并且代码质量良好,遵循了已有的 `session_held_*` 模式。如果可能,后续可添加对应的单元测试,但并非阻塞条件。
支持RunAI流式加载量化检查点
值得精读。该 PR 涉及模型加载架构的重要扩展,特别是流式生成器模式、缓冲区管理策略(`_clone_if_runai_streamed_tensor`)以及路由设计中的防御性编程,对理解 SGLang 的加载器体系有参考价值。
升级 AI-Infra 技能包,替换 benchmark 并新增 incident triage 与分阶段 profiler 脚本
值得阅读以了解 SGLang 生态中 AI-Infra 技能包的架构和设计思路,尤其是跨框架 benchmark 配置校验和分阶段 profiler 的实现。建议后续跟进 review 中的文档改进建议。
修复 FLUX.2 NVFP4 在 B200 上的量化正确性
值得精读。关注 process_weights_after_loading 的条件化设计、per-GEMM z-score 调试方法。建议未来建立可配置命名映射机制。
新增NIXL后端参数环境变量配置
值得快速查看以了解 NIXL 后端的参数注入机制。若团队后续需支持更多后端参数,可考虑采用字典映射重构线程参数注入部分,但当前保持原样也合理。
重构Multimodal调度器请求分发与warmup日志逻辑,拆分辅助方法
建议阅读以了解Multimodal调度器的请求处理架构。`_first_generation_req` 和 `_dispatch_request` 的设计模式可以复用。但PR缺少单元测试,建议在后续合并前补充对辅助方法的测试,尤其是边界情况。
在所有请求池中预留 slot 0 作为填充
推荐精读,尤其是关注 `HybridReqToTokenPool` 中 Mamba 映射大小的对齐问题。本 PR 展示了如何通过一个简单统一的 padding 约定,为未来的复杂功能(DSv4)提前消除数据竞争风险,是典型的前置兼容性变更。
参与讨论