Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 20:51 同步状态:空闲 下次计划:2026-09-02 21:51

PR 列表

更多筛选
2026-07-31
功能 重要性 8.75 洞察度 7.00

统一内存池放开 paged MLA 注意力后端,并修复 cuda-graph 静默错读

值得精读。核心看点:(1) `create_flashmla_kv_indices_triton` 用 kernel 内 v2p gather + `PAGE_MULT` 取代 host 端 remap,省一次 launch 与临时 tensor;(2) 用能力探测(`full_v2p_page_table` 是否存在)而非 multiplier 推断 unified pool,规避单层 MLA 配置的静默错读;(3) flashinfer decode 采用原地写回而非 per-role allowlist 分裂,并明确依赖 flashinfer `plan()` 的复制合约;(4) cuda-graph 下“图外预计算 dense 写位置 + replay 前清零尾部”的写法,解决 pad 行 stale loc 问题。PR body 中关于 GSM8K 0.000 的复现与诊断过程(无 crash、无警告、仅在服务有负载历史后出现)本身就是很好的 cuda-graph 调试案例。

缺陷修复 重要性 4.96 洞察度 4.00

清空 FlashInfer BF16 置换索引缓存,修复 RL 权重更新损坏

值得精读的短小修复。虽然改动只有 5 行,但背后是 RL 权重热更新与 GPU 缓存生命周期的经典冲突。建议关注两点:一是“在周期开始时清空缓存、周期内继续复用”的权衡;二是向后续维护者提示同类缓存(如 MXFP8、NVFP4 之外的其他后端缓存)需要一并审计。对从事 RL 训练、权重热更新或 FlashInfer 后端的工程师尤其有参考价值,后续应跟进正式单测。

功能 重要性 5.78 洞察度 5.00

diffusion rollout 返回调度器 sigmas 快照

建议精读本 PR 的语义设计:它给出了一个很好的范例——服务端把调度器内部的精确元数据直接外抛,而不是让下游从有限信息反推。尤其值得关注 `_slice_rollout_trajectory_for_sample` 中“元数据不做逐样本切片”的处理方式,以及作者后续将 `timesteps` 也切换到 `scheduler.timesteps` 的计划;若该计划落地,会彻底统一扩散 rollout 轨迹的时间轴语义。

文档 重要性 2.16 洞察度 2.00

更新 triton-ascend 安装指南链接

此 PR 为简单的文档链接更新,不建议精读。值得关注的是文档维护的规范性,建议后续检查其他文档中是否有类似的过期链接。

缺陷修复 重要性 6.37 洞察度 5.00

移除误加的 MXFP8 在线量化拦截,恢复线性层 bf16 量化

值得快速精读,特别是作为“重构引入回归”的诊断案例:guard 的可达性分析、重构提升作用域时的风险、以及量化路径统一在 `process_weights_after_loading` 处理权重 dtype 的设计原则。建议后续为在线 MXFP8 线性层初始化补充回归测试,并检查是否存在对旧属性 `use_min_latency_fc1_gemm` 的外部引用。

性能优化 重要性 9.06 洞察度 6.00

统一 verify mask 所有权,无人读取时压缩为 QLEN_ONLY

值得精读。该 PR 是一个高质量的重构范例:用单一所有者收敛五份分歧分配、把布局与容量绑定防止公式漂移、对无人读取的掩码走紧凑布局,并顺带修复两个派发器缺陷。重点关注 `verify_mask.py` 的设计(`tree_mask_numel` 与 `fits` 的分工)、`fits()` 对 `FULL_MASK` 的豁免理由,以及 `TboAttnBackend` 因 property 导致 `__getattr__` 失效的细节。对后续做 phase 级缓冲抽象有直接参考价值。

缺陷修复 重要性 6.88 洞察度 4.00

修复 GLM 模板对混合 tool_result 丢失 schema 的问题

值得精读。核心看点是:在协议边界拆分消息而不是修改聊天模板,以适配不同厂商模板的渲染假设;同时展现了 review 如何收敛过宽的通用方案。适合关注 Anthropic 兼容层、多模型聊天模板渲染的工程师阅读。建议后续补充更多边界场景测试。

功能 重要性 9.18 洞察度 6.00

统一内存池支持 MLA 混合 Mamba(Kimi-Linear)Triton 后端

值得精读。这个 PR 的索引抽象设计很有学习价值:把 page-major 信封直接当作 dense paged pool、用 `torch.as_strided` 构造重叠视图、以及 compaction 只管 virtual→physical 表从而让上层引用永不失效的思路,比引入新的物理布局或搬移数据优雅得多。阅读时建议重点对照三份文件:`build_dense_mla_views`(视图与寻址公式)、`translate_kv_loc_dense`(dense 空间约定)、`HybridLinearKVPool` 的 `full_loc` 路由(写路径接线)。合并前请确认两件事:P1 的 FNUZ dtype 归一化是否已在后续 PR 修复,以及 rebase 后的 CI 状态。

参与讨论