Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 19:08 同步状态:空闲 下次计划:2026-09-01 20:08

PR 列表

更多筛选
2026-08-14

#34848 Fix MiniMax-H3 Cache-DiT BCG warning

原始 PR · 作者 mmangkad · 合并时间 2026-08-14 22:07

缺陷修复 重要性 5.15 洞察度 4.00

修复 MiniMax-H3 在 BCG 下 Cache-DiT 的 AttributeError

值得快速阅读,理解 PR#34242 与 H3 override 的边界交互。设计上采用“入口分流、委托基类”的方式,避免在 BCG 下重复实现缓存挂载,是一个简洁且风险可控的修复。对后续在扩散模型阶段叠加运行时开关有借鉴意义。

性能优化 重要性 7.14 洞察度 5.00

MiniMax-M3 共享与路由专家在 CUDA 图上双流重叠

值得精读。该 PR 展示了利用 CUDA 备用流在 MoE 内部重叠独立计算分支的通用手段,是 CUDA Graph 捕获模式下性能优化的典型范例。建议关注 `get_is_capture_mode()` 与 `alt_stream` 的组合使用方式,并为该路径补充单元测试或 CI 验证。

性能优化 重要性 8.37 洞察度 6.00

embedding 缓存 H2D/D2H 批量直拷,碎片吞吐提升约 3-5 成

值得精读。transfer.cu 中 cudaMemcpyBatchAsync 的动态探测 + ABI 分派 + 多级回退模式,可作为 sgl-kernel 新增 CUDA 算子的参考实现;embedding_cache_controller.py 的「计划构建与执行分离」也值得在缓存迁移场景复用。关注 embedding cache/EPD 的工程师建议按 key_files 顺序阅读,重点看 _copy_embedding_page_runs 与 transfer_embedding_ranges_direct 的完整实现。

重构 重要性 8.77 洞察度 3.00

移除失效的 torchao 集成与 --torchao-config 参数,精简量化链路

该 PR 值得快速浏览作为"功能移除"的范例:体现了在依赖升级导致功能失效后,直接删除而不是保留死代码的决策逻辑。对于关心量化功能现状的读者,重点看 `server_args.py` 中参数删除方式、`loader.py` 中分层加载分支的收敛,以及 `docs/docs/advanced_features/quantization.mdx` 中支持矩阵的更新。不建议作为架构参考深入精读。

文档 重要性 4.75 洞察度 2.00

Ascend NPU 新增 Qwen3.8-Max 部署教程并接入文档导航

建议按需精读:若你负责 NPU 平台文档或需要在昇腾硬件上部署 Qwen3.8-Max,该教程的部署脚本、特性矩阵与 best-practices 联动值得细读;对普通工程师而言,本 PR 无源码价值,扫读结论即可。值得关注的设计:文档以 daily build 镜像作为与 main 分支同步的手段,并将示例参数与 `parameter_tuning` 锚点联动,体现了大型部署文档的可持续维护思路。

#34823 Skip oow slot freeing under eagle

原始 PR · 作者 ispobock · 合并时间 2026-08-14 17:13

缺陷修复 重要性 5.25 洞察度 4.00

EAGLE 下跳过 OOW slot 释放,修复 SWA 混合模型崩溃

值得精读。该 PR 展示了一个由默认开关翻转引发的跨模块单位不匹配问题,修复手法简洁(条件跳过),但根因分析透彻,适合作为“默认开关风险”的案例。关注点:`free_out_of_window_slots` 与 `tree_core.is_eagle` 的交互、EAGLE bigram 索引与 raw token 的换算关系,以及后续是否会补充真正的单位转换修复。

#34242 [diffusion] Warn when BCG disables Cache-DiT

原始 PR · 作者 chilltongx · 合并时间 2026-08-14 16:45

缺陷修复 重要性 5.84 洞察度 4.00

BCG 下 Cache-DiT 静默禁用,现补一次性警告

值得快速浏览而非精读:改动虽小,但“一次性告警 + 请求级路径覆盖 + 测试对全局去重函数做 cache_clear 隔离”的设计可作为同类静默失效问题的修复模板。若后续要扩展 Cache-DiT 与 BCG 的兼容性,本 PR 的告警位置是天然入口。

性能优化 重要性 5.67 洞察度 5.00

DSPARK 在 verify 发布 WAR read-done,提升重叠调度

值得精读,尤其是 `SharedReadBoundary.IN_REPLAY` 与 `POST_REPLAY` 的语义差异,以及推测解码算法相位(draft_extend / target_verify)如何与调度器 WAR 屏障对接。建议与 DSpark 系列近期修复(#34782、#34759)一起阅读,理解 DSpark 单步 decode 同步开销的持续优化脉络。评审时可关注 spec_info.py 中与 is_dflash_family 重复的判定,建议后续清理或补充注释说明。

参与讨论