Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-05 02:29 同步状态:空闲 下次计划:2026-09-05 03:29
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-06-06

#27396 Cookbook for QAT

原始 PR · 作者 kpham-sgl · 合并时间 2026-06-06 02:18

文档 重要性 4.08 洞察度 2.00

为 Gemma 4 部署交互文档新增 QAT 检查点支持

建议合入。这是一个低风险、高收益的文档更新,通过交互式组件降低了用户使用 QAT 检查点的门槛,符合 SGLang 持续丰富模型部署指南的方向。

缺陷修复 重要性 7.19 洞察度 6.00

修复 PD 解耦中止时 KV 缓存损坏

该 PR 值得精读,尤其是设计决策:轻量通知 vs 延迟释放。了解 PD 解耦系统中 abort 处理的权衡对相关开发者有帮助。但需注意代码中未处理的消息解析风险。

#26480 feat(agentic router, 1/N): Add LoadBasedPolicy

原始 PR · 作者 hzh0425 · 合并时间 2026-06-06 00:13

功能 重要性 8.71 洞察度 4.00

新增 LoadBasedPolicy 路由策略,按最低活跃负载选择 worker

该 PR 值得精读,尤其是 `LoadBasedPolicy` 的实现简洁且符合 `Policy` trait 约定,可作为自定义路由策略的范本。Review 中提出的 herd effect 和测试 flaky 问题是关注的焦点,建议在实际部署前评估并解决这些潜在风险。此外,`SelectionContext` 中的 `routing_key` 字段暗示了未来的扩展方向,值得留意后续工作。

2026-06-05
功能 重要性 9.00 洞察度 5.00

为 multimodal_gen 添加 Ideogram 4 FP8 文生图支持

值得精读。该 PR 展示了在 SGLang 框架中系统性地添加新扩散模型的完整流程,包括配置、模型、pipeline 和测试,尤其是通过继承基类减少重复代码和共享工具函数的设计思路值得学习。

缺陷修复 重要性 3.84 洞察度 4.00

修复 CUDA 13 下 activation.cuh JIT 编译失败

值得立即合入,特别是需要支持 CUDA 13 的用户。关注点:建议在 CI 中增加 CUDA 13 的 JIT 编译测试,防止类似问题再次发生。该 PR 展示了处理编译器版本差异模板问题的通用技巧。

#27358 HiCache: Fix Flaky CI For 3FS Backend

原始 PR · 作者 hzh0425 · 合并时间 2026-06-05 22:00

缺陷修复 重要性 3.27 洞察度 4.00

修复 HiCache 3FS 测试的 CI 配置

建议回退该 PR 的变更,或同步更新 CI 套件配置(如 `.github/workflows/pr-test.yml` 等),确保 `base-b-test-4-gpu-h100` 套件存在。同时,应审查测试是否确实需要 4 GPU 资源,或者是否可以通过其他方式(如增加超时、重试机制)来解决不稳定问题。

参与讨论