Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 22:27 同步状态:空闲 下次计划:2026-09-03 23:27

PR 列表

更多筛选
2026-06-13
重构 重要性 8.54 洞察度 6.00

将 draft-extend prep 移到 Worker 基类并统一方法命名

值得精读。该 PR 展示了如何通过重构消除架构异味(数据类不该持有方法)、统一命名规范,并体现了良好的小型重构实践。对于关注 speculative decoding 模块的开发者,这是熟悉模块结构的好机会。

缺陷修复 重要性 5.98 洞察度 6.00

修复 FlashInfer A2A 在 moe_dense_tp_size 设置时 NaN 问题

值得精读,尤其是 MoE 分布式推理中 `global_num_tokens` 跨 rank 一致性的设计权衡。`require_mlp_tp_gather` 作为通用检测函数值得在其他分发器中借鉴。建议后续增加自动化测试覆盖 `moe_dense_tp_size != 1` + FlashInfer A2A 组合。

缺陷修复 重要性 6.53 洞察度 5.00

修复 EagleDraftWorker 草稿扩展注意力后端未赋值问题

值得合并。此 PR 修复了一个早期重构引入的回归,并改进了自适应状态切换的代码健壮性。建议在后续类似重构中保留跨模块的前向传播依赖检查。

缺陷修复 重要性 5.66 洞察度 5.00

修复PR关闭时取消工作流遗漏后续工作流的问题

建议阅读该 PR 的实现,特别关注如何使用 `gh api` 组合分页和过滤来实现可靠的取消逻辑。该模式可用于其他需要针对分支取消运行或清理资源的场景。代码内联注释清晰,易于理解。

基础设施 重要性 5.17 洞察度 5.00

为AMD CI新增label-gated extra-a测试层

值得关注的设计决策:采用与CUDA模式一致的标签门控策略,运行时检查标签以支持rerun时正确识别;采用single-job而非分区以节省AMD GPU资源;利用`workflow_call`将extra-a链入定时调度。这些模式可供后续AMD测试层扩展参考。

#25881 Fix Responses API request handling

原始 PR · 作者 JustinTong0323 · 合并时间 2026-06-13 05:47

缺陷修复 重要性 9.18 洞察度 7.00

修复并增强 Responses API,新增函数工具与流式 SSE

**强烈建议精读**:本 PR 是 SGLang 中 Responses API 从“概念验证”走向“生产可用”的关键合并。它展示了如何将多个贡献者的修复高效整合、通过细致的代码评审(alexnails 的深度评论)识别潜在生产问题、以及如何设计兼容 OpenAI 规范的端点。`serving_responses.py` 中的输入规范化、流式生成和工具提取逻辑值得深入理解。

参与讨论