修复 Diffusion LoRA 精度与一致性验证
该 PR 修复了 diffusion LoRA 多个边界情况,并加强了测试覆盖,值得 review 和 merge。特别关注 FP32 合并默认值变更和 lora_alpha 加载的设计决策。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 Diffusion LoRA 精度与一致性验证
该 PR 修复了 diffusion LoRA 多个边界情况,并加强了测试覆盖,值得 review 和 merge。特别关注 FP32 合并默认值变更和 lora_alpha 加载的设计决策。
原始 PR · 作者 kkHuang-amd · 合并时间 2026-05-28 06:23
修复 DSV4 MTP 在 ROCm 上的 CUDA Graph 捕获并优化注意力与融合 kernel
建议精读。该 PR 展示了如何在不破坏 CUDA 路径的前提下为 ROCm 修复关键错误并注入性能优化,其设计权衡(始终 eager 构造、fused kernel 阈值选择、三级 fallback 模式)值得学习。尤其推荐关注 `deepseek_v4_fused_mhc.py` 中的缓冲池与运行时禁用机制。
DeepSeek V4 切换到 sgl-kernel 内部 FlashMLA
可以快速合并。此 PR 是 sgl-kernel 整合系列的一部分,建议配合关联的 sgl-kernel 版本发布(如 PR #26421)一起部署。
上下文并行支持 batch size > 1
值得精读,尤其 `ContextParallelMetadata` 从单序列到多序列的设计演进,以及 padding 策略的权衡。讨论中的 CPU 开销担忧和未来 Triton 替代方向值得关注。架构师应关注 DSA 路径的遗留 TODO。
Blackwell SM100+ 添加 FlashInfer GDN prefill 支持
该 PR 是 Blackwell 推理栈的重要补齐,设计决策清晰(状态预分配、clamp 保护、版本校验)。值得关注: - SM100 / SM90 两条路径的差异(state pool vs gather/scatter)及初始化分支逻辑; - 如何通过预分配 bf16 output_state 消除类型转换开销; - 对上游 FlashInfer 版本的依赖管理。 推荐阅读核心内核文件 `gdn_flashinfer.py` 的 `extend` 方法,以理解 FlashInfer 集成模式。
原始 PR · 作者 sglang-bot · 合并时间 2026-05-28 02:31
sglang-kernel 版本从 0.4.2.post2 升级至 0.4.3
该 PR 为常规依赖升级,价值有限。无需精读,但可关注 sglang-kernel 0.4.3 的 release note 了解具体包含的修复或特性。
原始 PR · 作者 jasonjk-park · 合并时间 2026-05-28 00:54
为自定义推测算法添加分离支持,重构 Eagle 专用逻辑
值得精读,展示了通过面向对象多态方法解耦调度逻辑的设计模式。建议尽快补充:1)空批次和 hidden states 为 None 的防御性检查;2)针对新增接口编写单元测试,覆盖 Eagle 和非 Eagle 分支的分离场景。
为 ASR 添加 WebSocket 实时音频输入端点
值得精读。该 PR 展示了如何在现有架构上集成实时双向协议,对理解 OpenAI Realtime 协议实现、异步状态机设计、跨路径一致性处理(HTTP SSE vs WebSocket)有较高学习价值。建议关注 `session.py` 的状态隔离设计和 `streaming_asr.py` 的 `emitted_text` 改动。
参与讨论