Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-05 01:23 同步状态:空闲 下次计划:2026-09-05 02:23

PR 列表

更多筛选
2026-04-02

#20004 Multi tool streaming fix

原始 PR · 作者 kpham-sgl · 合并时间 2026-04-02 12:53

缺陷修复 重要性 6.00 洞察度 5.00

修复Qwen25模型流式多工具调用解析失败问题。

建议工程师精读此PR,关注解析逻辑中的错误处理模式和回退机制设计,这对于处理复杂格式的流式解析有参考价值,特别是涉及多工具调用场景时。

性能优化 重要性 6.00 洞察度 7.00

融合温度缩放与softmax采样内核,减少解码延迟。

建议工程师精读`fused_sampling.py`以学习Triton内核设计和自动调优策略,关注条件阈值选择和预热机制。性能优化显著,适用于性能敏感场景,值得作为内核优化案例参考。

基础设施 重要性 3.00 洞察度 2.00

在Trivy安全扫描中跳过Go标准库和NVIDIA工具目录,消除约500个不可修复的误报警报。

该PR变更简单直接,无需深入技术分析。建议关注点:1) 了解Trivy skip-dirs配置的使用场景;2) 注意基础镜像依赖带来的安全扫描噪音问题;3) 可作为类似CI配置优化的参考案例。

#20289 Enable multi-thread weight loading by default

原始 PR · 作者 b8zhong · 合并时间 2026-04-02 12:27

功能 重要性 5.00 洞察度 3.00

将多线程权重加载默认值从False改为True,提升模型冷启动性能。

该PR变更简单但影响默认行为,建议团队关注CI测试结果,确保无回归。对于深入理解模型加载优化,可结合Issue #12529中的其他改进方案(如Runai streamer集成)一起阅读。

#21901 Support PP key for file backend

原始 PR · 作者 hzh0425 · 合并时间 2026-04-02 12:23

功能 重要性 4.00 洞察度 3.00

为HiCache文件后端添加流水线并行(PP)键支持,扩展存储配置命名空间。

建议关注此PR作为HiCache支持流水线并行的第一步。虽然变更本身简单,但需要理解其在整个兼容性解决方案中的定位。重点关注配置后缀生成逻辑的变化,以及后续PR如何在此基础上构建完整功能。

重构 重要性 6.00 洞察度 4.00

将所有调用者从弃用的/get_server_info迁移到新的/server_info端点,清理API表面。

建议开发团队快速浏览此PR,关注API清理的最佳实践和弃用管理。对于新贡献者,理解如何管理端点弃用是有价值的学习案例。变更直白,无需深度技术分析,但值得参考以确保未来类似重构的顺利进行。

#21767 [CI] add nvfp4 ci test for b200;

原始 PR · 作者 Prozac614 · 合并时间 2026-04-02 11:31

基础设施 重要性 4.00 洞察度 4.00

为B200 GPU添加NVFP4量化扩散模型CI测试路径。

建议CI维护者和测试工程师精读此PR,关注CI job配置、测试套件设计以及性能基线更新策略,这些决策对后续硬件扩展有借鉴意义。

基础设施 重要性 3.00 洞察度 2.00

移除导致夜间测试崩溃的Kimi K2.5 MTP变体,保留TP8和TP8+DP8配置。

该PR值得快速浏览,以了解CI测试配置的调整。关注点:1) 移除MTP变体的具体原因(OOM和未知错误);2) 新增TP8+DP8变体的配置;3) 测试覆盖范围的变化。对于负责CI或测试的工程师,建议检查是否有其他测试需要类似调整。

参与讨论