修复 Pi0.5 语言嵌入缩放缺失,对齐 OpenPI 输出
值得精读。重点看 `build_openpi_model_inputs` 与 `_preprocess_image` 两个设计点:前者演示了如何用参考实现自身的输入变换构造一致性对比,后者用显式标记避免图像归一化歧义。该 PR 为「与官方实现的数值一致性」提供了可执行、可回归的测试范本。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 Pi0.5 语言嵌入缩放缺失,对齐 OpenPI 输出
值得精读。重点看 `build_openpi_model_inputs` 与 `_preprocess_image` 两个设计点:前者演示了如何用参考实现自身的输入变换构造一致性对比,后者用显式标记避免图像归一化歧义。该 PR 为「与官方实现的数值一致性」提供了可执行、可回归的测试范本。
diffusion 注意力路径拒绝 ring 并行,防止静默算错
值得精读,虽然改动只有 18 行,但它是一个很好的“fail-fast 安全守卫”范例:在特性未完成前显式拒绝而非静默降级。推荐关注三点:`get_ring_parallel_world_size()` 与 Ulysses all-to-all 的交互边界、`UlyssesAttention` 与 `USPAttention` 的职责划分、以及守卫风格的统一(后续应保持同文件相同模式)。由于是基础注意力层,建议复制 `py_compile` 之外至少加一个微小的单测覆盖,防止守卫被无意删除。
修复调度器 max-new-tokens 测试 fixture
值得快速浏览,了解测试 fixture 如何与生产代码演进保持同步;可作为小规模回归修复的范例。
原始 PR · 作者 CyberSecurityErial · 合并时间 2026-08-04 10:55
修复 FlashMLA 自然对数 LSE 在 DCP 合并中的误算
值得精读。三个亮点:一是用 `tl.constexpr` 把运行时逐元素分支变成编译期特化,兼顾正确性与性能;二是数值例证的测试设计(log(2)、log(8) 与 10 组装出 8.0)极简且直击根因;三是 `_is_mla_dcp_lse_base_on_e` 这种集中式后端契约函数,可作为同类'后端行为差异'问题的处理样板。建议留意未来新增 MLA attention 后端时同步维护该映射。
DCP 按聚合 KV 池限制请求长度
值得精读:这是理解 SGLang DCP 计费模型(per-rank 池 vs 聚合池)的一个极佳切入点,`scheduler.py` 中与 `PrefillAdder` 一致性相关的注释值得注意。建议合入后补充一个 `dcp_size > 1` 的准入与 `max_new_tokens` 预算单元测试,并顺手核对 `PrefillAdder` 的准入预算是否同样基于聚合池,防止未来出现新的口径分裂。
helion 依赖从 0.2.6 升至 1.4
不值得精读,代码量极低且无讨论深度。值得关注的点是:跨 major 版本升级却完全没有测试配套,且合并时 CI Extra 失败被 bypass-fastfail 绕过;建议后续在主干上观察 helion 1.4 相关回归,必要时补一个快速安装/导入冒烟测试。若要学习流程细节,可参考作者用 self-review suggestion 修正版本号的小操作。
修复 DCP 下 MLA KV 越界检查误报
建议阅读该 PR 以理解 DCP 下逻辑索引与物理索引空间的口径差异。修复本身非常直接,但思路值得借鉴——在 DCP 或任何跨卡并行场景中,OOB 检查必须与内核实际的索引映射保持一致。可顺带排查 memory_pool.py 中其他使用物理容量做上界的断言(如 get 路径)是否存在类似误报风险。
回滚 flashinfer rmsnorm+FP8 量化融合,修复 CI 失败
这是一次典型的“快速止血”型 revert,值得快速浏览以理解 kernel 特性合入在 CI 层面的依赖风险:新 kernel 合入前必须确保 CI 先构建并安装对应 sgl-kernel,再运行依赖它的测试。对量化路径优化感兴趣的同学,建议精读被回滚 diff 中 layernorm.py 的融合入口设计、_fp8_static_input_scale 的识别逻辑以及 apply_fp8_linear 的 pre_quant_output_dtype 契约——它们是将来的 #33469/#33471 重新合入时最有价值的设计资产。
参与讨论