调整 KL 散度测试阈值为 0.02
建议合并,但需要添加明确的动机说明(例如引用具体的 CI 失败链接或 KL 散度分布数据)。此外,删除冗余注释后代码更简洁。
SGLang is a high-performance serving framework for large language models and multimodal models.
调整 KL 散度测试阈值为 0.02
建议合并,但需要添加明确的动机说明(例如引用具体的 CI 失败链接或 KL 散度分布数据)。此外,删除冗余注释后代码更简洁。
原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-05-17 04:05
回退 workspace buffer 初始化重构,修复残缺 wrappers 问题
建议立即跟进修复 `init_mha_chunk_metadata` 中的 `AttributeError`,在调用父类前增加 `hasattr(self, 'mha_chunk_kv_cache')` 检查或条件保护。长期而言,可重新设计 workspace 初始化方案,兼顾子类复用与父类完整性,但需确保所有代码路径下 wrapper 初始化完备。
DSV4 部署文档清理环境变量,新增 MegaMoE 切换
建议阅读此 PR 的文件变更,了解 DSV4 部署配置的演进。特别关注如何通过前端配置实现后端功能选项的添加和清理。
DSV4 文档使用统一 Docker 镜像
可快速合并。建议验证 `latest` 镜像在多平台上的可用性。
原始 PR · 作者 zhengluo-nv · 合并时间 2026-05-17 02:16
将ModelExpress加载委托给外部包
值得精读。此PR展示了如何通过委托外部包来大幅简化代码,同时保持清晰的集成表面。对于设计模块化系统、管理跨仓库依赖的团队有参考价值。特别是`loader.py`中从内部函数调用到外部类加载器的转变,以及`model_runner.py`中防止重复注册的条件逻辑,都是良好的设计模式。
修复 DeepSeek V4 HiCache 层计数逻辑并拆分测试 CI
此 PR 修复了关键的 PP + HiCache 兼容性问题,核心逻辑改动集中在层映射计算,值得精读以理解 PP 对缓存层的影响。同时应关注两个遗留风险:state pools 索引偏移和测试空覆盖,建议在后续 PR 中跟进修复。
拆分 diffusion 量化 CI 为 FP8 和 B200 两套测试
值得阅读,尤其是了解如何通过简单的配置拆分优化 CI 硬件利用率。建议关注 `gpu_cases.py` 中列表定义的模式,以及 `diffusion_case_parser.py` 中分区映射的写法,这种模式可以在其他需要硬件隔离的测试场景中复用。
扩散模型 VAE 默认精度改为 bf16
该 PR 质量良好,数据充分,值得合并。建议精读 MOVA 的 AMD 编译错误修复,理解 AMD 平台上的兼容性限制,并在未来引入类似精度优化时注意测试 AMD CI。
参与讨论