Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-04 00:39 同步状态:空闲 下次计划:2026-09-04 01:39

PR 列表

更多筛选
2026-05-17

#25497 Update kl_div_thres to 0.02 in swa_radix_cache

原始 PR · 作者 ch-wan · 合并时间 2026-05-17 07:43

测试 重要性 3.11 洞察度 2.00

调整 KL 散度测试阈值为 0.02

建议合并,但需要添加明确的动机说明(例如引用具体的 CI 失败链接或 KL 散度分布数据)。此外,删除冗余注释后代码更简洁。

缺陷修复 重要性 6.74 洞察度 5.00

回退 workspace buffer 初始化重构,修复残缺 wrappers 问题

建议立即跟进修复 `init_mha_chunk_metadata` 中的 `AttributeError`,在调用父类前增加 `hasattr(self, 'mha_chunk_kv_cache')` 检查或条件保护。长期而言,可重新设计 workspace 初始化方案,兼顾子类复用与父类完整性,但需确保所有代码路径下 wrapper 初始化完备。

#24723 Delegate ModelExpress loading to package

原始 PR · 作者 zhengluo-nv · 合并时间 2026-05-17 02:16

重构 重要性 9.00 洞察度 5.00

将ModelExpress加载委托给外部包

值得精读。此PR展示了如何通过委托外部包来大幅简化代码,同时保持清晰的集成表面。对于设计模块化系统、管理跨仓库依赖的团队有参考价值。特别是`loader.py`中从内部函数调用到外部类加载器的转变,以及`model_runner.py`中防止重复注册的条件逻辑,都是良好的设计模式。

2026-05-16
缺陷修复 重要性 7.75 洞察度 5.00

修复 DeepSeek V4 HiCache 层计数逻辑并拆分测试 CI

此 PR 修复了关键的 PP + HiCache 兼容性问题,核心逻辑改动集中在层映射计算,值得精读以理解 PP 对缓存层的影响。同时应关注两个遗留风险:state pools 索引偏移和测试空覆盖,建议在后续 PR 中跟进修复。

#24599 [codex] Split diffusion quant CI coverage

原始 PR · 作者 BBuf · 合并时间 2026-05-16 22:05

基础设施 重要性 4.84 洞察度 4.00

拆分 diffusion 量化 CI 为 FP8 和 B200 两套测试

值得阅读,尤其是了解如何通过简单的配置拆分优化 CI 硬件利用率。建议关注 `gpu_cases.py` 中列表定义的模式,以及 `diffusion_case_parser.py` 中分区映射的写法,这种模式可以在其他需要硬件隔离的测试场景中复用。

功能 重要性 5.84 洞察度 5.00

扩散模型 VAE 默认精度改为 bf16

该 PR 质量良好,数据充分,值得合并。建议精读 MOVA 的 AMD 编译错误修复,理解 AMD 平台上的兼容性限制,并在未来引入类似精度优化时注意测试 AMD CI。

参与讨论