将 draft-extend prep 移到 Worker 基类并统一方法命名
值得精读。该 PR 展示了如何通过重构消除架构异味(数据类不该持有方法)、统一命名规范,并体现了良好的小型重构实践。对于关注 speculative decoding 模块的开发者,这是熟悉模块结构的好机会。
SGLang is a high-performance serving framework for large language models and multimodal models.
将 draft-extend prep 移到 Worker 基类并统一方法命名
值得精读。该 PR 展示了如何通过重构消除架构异味(数据类不该持有方法)、统一命名规范,并体现了良好的小型重构实践。对于关注 speculative decoding 模块的开发者,这是熟悉模块结构的好机会。
修复 FlashInfer A2A 在 moe_dense_tp_size 设置时 NaN 问题
值得精读,尤其是 MoE 分布式推理中 `global_num_tokens` 跨 rank 一致性的设计权衡。`require_mlp_tp_gather` 作为通用检测函数值得在其他分发器中借鉴。建议后续增加自动化测试覆盖 `moe_dense_tp_size != 1` + FlashInfer A2A 组合。
修复 EagleDraftWorker 草稿扩展注意力后端未赋值问题
值得合并。此 PR 修复了一个早期重构引入的回归,并改进了自适应状态切换的代码健壮性。建议在后续类似重构中保留跨模块的前向传播依赖检查。
修复PR关闭时取消工作流遗漏后续工作流的问题
建议阅读该 PR 的实现,特别关注如何使用 `gh api` 组合分页和过滤来实现可靠的取消逻辑。该模式可用于其他需要针对分支取消运行或清理资源的场景。代码内联注释清晰,易于理解。
原始 PR · 作者 Kangyan-Zhou · 合并时间 2026-06-13 06:20
修复被引号包裹的 ResponseTool 注解破坏所有 PR 的 lint
立即合并,无需深度审查。这是一个标准的 lint 修复,简单且必要。
原始 PR · 作者 michaelzhang-ai · 合并时间 2026-06-13 06:12
为AMD CI新增label-gated extra-a测试层
值得关注的设计决策:采用与CUDA模式一致的标签门控策略,运行时检查标签以支持rerun时正确识别;采用single-job而非分区以节省AMD GPU资源;利用`workflow_call`将extra-a链入定时调度。这些模式可供后续AMD测试层扩展参考。
修复 Nemotron Cookbook 文档不一致
纯文档修订,无明显风险,可供用户直接参考。
原始 PR · 作者 JustinTong0323 · 合并时间 2026-06-13 05:47
修复并增强 Responses API,新增函数工具与流式 SSE
**强烈建议精读**:本 PR 是 SGLang 中 Responses API 从“概念验证”走向“生产可用”的关键合并。它展示了如何将多个贡献者的修复高效整合、通过细致的代码评审(alexnails 的深度评论)识别潜在生产问题、以及如何设计兼容 OpenAI 规范的端点。`serving_responses.py` 中的输入规范化、流式生成和工具提取逻辑值得深入理解。
参与讨论