在diffusion测试中自动跳过缺少所需pipeline类的测试,提升CI稳定性。
该PR变更较小,工程师可快速浏览以理解CI优化逻辑,但无需深入分析代码细节。值得关注的是review中关于错误处理精确性的讨论,对于设计稳健的测试框架和异常处理机制有借鉴意义。
SGLang is a high-performance serving framework for large language models and multimodal models.
在diffusion测试中自动跳过缺少所需pipeline类的测试,提升CI稳定性。
该PR变更较小,工程师可快速浏览以理解CI优化逻辑,但无需深入分析代码细节。值得关注的是review中关于错误处理精确性的讨论,对于设计稳健的测试框架和异常处理机制有借鉴意义。
原始 PR · 作者 ShangmingCai · 合并时间 2026-03-23 12:13
临时禁用 CI 中不稳定的 Qwen3-30B 上下文并行测试。
该 PR 变更简单,主要用于 CI 维护,不值得精读;但如需了解 CI 测试禁用机制,可关注 `register_cuda_ci` 函数的用法。
临时修复 FlashInfer 统一传输在 GB 平台导致数据损坏的问题。
该 PR 值得精读,尤其关注上下文管理器设计和平台检测逻辑,展示了临时工作区的优雅实现方式。建议工程师学习其异常处理和环境集成的最佳实践,同时注意临时方案的移除时间点。
扩展denoise latency解析逻辑以支持模型特定的DenoisingStage变体,提升benchmark兼容性。
该PR值得快速浏览以了解latency解析的灵活性改进。关注字符串匹配的设计决策,以及潜在的多匹配风险。
原始 PR · 作者 fanghao566 · 合并时间 2026-03-23 10:58
修复启用指标时非流式请求中止失效的bug,通过修补中间件保持ASGI receive传递。
推荐精读此PR,特别是`_PureASGIDispatch`的设计,以了解如何处理ASGI中间件的receive传递问题,并关注测试策略从集成到单元的演变,体现了优化测试效率的实践。
添加FireRed-Image-Edit模型支持,解决配置差异问题。
该PR值得精读,了解如何通过配置适配扩展新模型支持,重点关注token ID字段的添加和注册逻辑的设计决策。
修复在启用重叠调度和结构化输出时的VRAM泄漏问题。
建议工程团队精读此PR,重点关注闭包环境下GPU张量生命周期的管理策略,可作为异步调度中内存优化的参考案例。
原始 PR · 作者 happierpig · 合并时间 2026-03-23 08:06
通过padding max-num-requests避免CUDA graph捕获中被过滤,提升性能覆盖范围。
建议精读以理解CUDA graph捕获中的padding策略和性能优化技巧,重点关注get_batch_sizes_to_capture函数的改动,对于涉及图形捕获的开发者有参考价值。
参与讨论