重命名 WAR 读完成快速路径为共享读完成,并重构事件所有权
值得精读 `decode_cuda_graph_runner.py` 中事件懒创建与边界解析的配合方式,以及 PR 对命名规则的沉淀;这是理解 scheduler 共享缓冲读完成屏障的极好入口。关注 `TODO` 中 `PRE_REPLAY -> POST_REPLAY` 的后续修正方向,以及“每个 runner 无条件发布”的演进计划。
SGLang is a high-performance serving framework for large language models and multimodal models.
重命名 WAR 读完成快速路径为共享读完成,并重构事件所有权
值得精读 `decode_cuda_graph_runner.py` 中事件懒创建与边界解析的配合方式,以及 PR 对命名规则的沉淀;这是理解 scheduler 共享缓冲读完成屏障的极好入口。关注 `TODO` 中 `PRE_REPLAY -> POST_REPLAY` 的后续修正方向,以及“每个 runner 无条件发布”的演进计划。
新增 pad 内核,支持 K3 12 头开启 AITER prefill
建议精读,核心在于处理 Triton `tl.arange` 非 2 的幂限制的通用技巧。值得关注的设计决策是保留原内核、仅通过 dispatch 新增 pad 分支,降低回归风险。后续若要在其他模型上启用类似优化,可复用该模式。
修复 dsv4 KL 测试超时,上调 est_time 并新增文件级超时
值得快速阅读,因为它展示了一个典型的 CI 超时诊断思路:跟踪默认超时、`est_time` 和分片算法之间的联动。若要深入学习,可进一步查看 `run_suite.py` 和 `compute_partitions.py` 的实现。推荐评分 4/10。
为 HTTP/2 服务新增可配置的并发流上限参数
值得快速浏览:适合关注 HTTP/2 部署、ServerArgs 校验模式和 Granian 配置接线的开发者。可以学习用 FakeEmbeddedServer 拦截 Server 构造来做配置传递断言的测试手法,以及"服务器显式拥有连接级容量并广播给客户端"的设计思路。该 PR 不涉及核心推理路径,无模型性能影响,不需要精读。
原始 PR · 作者 huangtingwei9988 · 合并时间 2026-08-16 00:37
更新 CODEOWNERS,新增 mem_cache 路径所有者
该 PR 属于纯流程性变更,不值得精读。可留意的是仓库维护者名单的动态变化,但无技术内容。
修复 Whisper 长音频静默截断,新增能量感知分块转写
值得精读。该 PR 是一个完整的"适配器扩展点 + 服务层通用编排"范例,核心看点:①能量感知切分与 vLLM 逐位对齐的兼容策略(切分点可复现);②`strip=False` 保留模型边界空白以正确处理无空格脚本的拼接语义;③`_build_chunk_request` 每块重建 `sampling_params` 以适配多模态处理器"消费式"取键的约定;④reviewer 对失败路径、并发上限、语言选择的三轮纠偏展示了生产级审查应当关注的边界。对要扩展新 ASR 适配器的工程师,这是必读示例。
定义 diffusion 原生集成契约,明确 TP/SP、VAE 并行与 offload 要求
该 PR 值得作为 diffusion 新模型贡献的入门必读,也是 review diffusion 相关 PR 时的核对基准。值得关注的设计取舍包括:将分布式能力从“可选增强”提升为“完整支持的必要条件”;用共享 VAE 组件约束 tiled 与 spatial_shard 解码;以及明确 Diffusers 兼容后端与原生集成契约的边界。普通读者无需逐行精读,但建议维护者对照实际代码验证文档中引用的类名与行为。
原始 PR · 作者 AgainstEntropy · 合并时间 2026-08-15 23:36
为扩散管线新增 LTX-2.5 完整支持
值得精读。建议重点关注三点:扩散解码器的性能优化组合(NATTEN 惰性探测、FlexAttention 编译、SwiGLU tile 大小、tiling 策略)、pipeline 的组件化装配(`component_uses` + `use_declared_component` 机制),以及蒸馏/完整权重双路径的 sigma 调度处理。同时跟踪后续 PR #36026。
参与讨论