修复 DeepSeek-VL2 基准测试图片处理
值得合并:修复明确且无副作用。建议后续为该函数补充单元测试(如使用 mock processor 测试各分支),提升可维护性。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 DeepSeek-VL2 基准测试图片处理
值得合并:修复明确且无副作用。建议后续为该函数补充单元测试(如使用 mock processor 测试各分支),提升可维护性。
原始 PR · 作者 michaelzhang-ai · 合并时间 2026-06-17 12:58
4 个 2-GPU 测试注册到 AMD CI
本 PR 是纯粹的 CI 注册变更,技术含量低,但作为 AMD CI 覆盖建设的一部分,值得团队关注其渐进式覆盖策略和从候选筛选中暴露的平台差异(如 kv-canary 内核仅 CUDA、模型权重复制不可用)。对于 CI 维护者和 AMD 平台开发者,建议阅读 PR body 中的决策记录,了解哪些测试被排除以及原因,以便后续在对应模块完成 ROCm 移植后重新注册。
修复 MoRI EP 缺少 BF16 分发分支导致模型精度错误
值得合并,修复了一个关键但隐蔽的精度 bug。建议后续补充针对 BF16 分支的单元测试,确保回归覆盖。
Flashinfer bmm_fp8 替代 CUTLASS 实现 SM100 FP8 线性层
建议仔细阅读 `fp8_utils.py` 中 `flashinfer_bmm_fp8` 的封装方式,以及 `modelopt_quant.py` 中条件路径的切换逻辑。该 PR 展示了如何在特定硬件上安全替换核心算子,并平衡通用性与性能。审阅中关于后端清理的建议也值得关注。
原始 PR · 作者 JustinTong0323 · 合并时间 2026-06-17 11:47
B300 GLM-5.2 验证结果更新至 cookbook
建议精读。该 PR 体现了规范的硬件支持验证流程:先推断 → 实测 → 更新文档。PR body 对性能差异的解释(B300 比 B200 慢的原因)具有参考价值,可作为 Blackwell 系列跨代性能分析的案例。
更新 CODEOWNERS 添加 multimodel_gen 负责人
变更简单明了,无需重点审查。但可作为团队协作规范参考。
修复diffusers后端非T2I模型PicklingError
该 PR 值得一读,它展示了在 Python 多进程环境中,动态类与 pickle 冲突的典型解决方案。对于维护者,建议在合并后尽快补充测试用例,确保 diffusers 后端与注册原生配置的兼容性;并考虑在新增 ModelTaskType 时更新映射字典的检查机制。
原始 PR · 作者 Kangyan-Zhou · 合并时间 2026-06-17 11:09
修复 sgl-router 镜像多架构与运行时崩溃
建议合并。变更有明确动机、验证充分,且此前引入的镜像缺陷属于功能性阻塞。CI 工作流结构清晰,可作多架构构建的参考模板。
参与讨论