Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-04 00:39 同步状态:空闲 下次计划:2026-09-04 01:39

PR 列表

更多筛选
2026-07-08

#29777 [diffusion] Support SP for Krea-2

原始 PR · 作者 AgainstEntropy · 合并时间 2026-07-08 10:39

功能 重要性 7.96 洞察度 6.00

为 Krea-2 添加序列并行(Ulysses)支持

此 PR 值得精读,特别是 `_forward_with_replicated_prefix` 的 GQA 修复和 `_shard_img_pos_for_sp` 的分片逻辑,展示了如何在扩散注意力中正确实现 Ulysses 序列并行。设计决策(replicated text prefix + sharded image tokens)对类似架构有参考价值。

基础设施 重要性 5.60 洞察度 5.00

MI355X 分解测试改用工作流检出代码运行

建议精读 `launch_mi355x.sh` 中暂存和安装逻辑的设计,该模式可推广到其他硬件 CI。注意 PYTHONPATH 尾随冒号问题虽未修复,但后续可合并小修复。PR 整体设计良好,opt-out 机制增加了稳健性。

#29742 [diffusion] Fix Z-Image accuracy

原始 PR · 作者 qimcis · 合并时间 2026-07-08 09:08

缺陷修复 重要性 9.18 洞察度 7.00

修复动态批处理下 Z-Image 的精度问题

本 PR 修复了一个影响用户体验的关键精度 bug,且实现细节(保持 bf16 精度的 RMSNorm、Triton 融合内核的 fallback 机制、基于主机端 ranges 的 varlen 掩码构建)具有通用参考价值。关注扩散模型批处理的设计者值得精读。建议在后续 PR 中考虑将 batched freqs_cis 缓存以进一步优化推理吞吐。

缺陷修复 重要性 8.79 洞察度 6.00

修复 DSV4 FP8 wo_a 量化 scale 布局错误并优化内存连续性

该 PR 修复了影响 DeepSeek-V4 FP8 推理正确性的关键 bug,设计上采用了更干净的专用 kernel 方案,测试也较为充分。建议合并,并考虑后续将 `scale_tma_aligned` 等遗留参数清理到独立 PR。

基础设施 重要性 4.97 洞察度 3.00

AMD CI 新增 multimodal_gen 单元测试覆盖

建议合并。这是一个标准的 CI 覆盖增强 PR,设计清晰、测试已验证通过。后续可以关注排除的测试文件是否能随 ROCm 环境改进而重新启用。

性能优化 重要性 6.36 洞察度 5.00

默认启用非分页索引器提升大块预填充性能

值得精读,尤其是 `indexer.py` 中阈值检查的插入位置和测试的边界覆盖设计,可供类似性能优化 PR 参考。建议关注未来是否将阈值调整为动态自适应。

参与讨论