修复Qwen25模型流式多工具调用解析失败问题。
建议工程师精读此PR,关注解析逻辑中的错误处理模式和回退机制设计,这对于处理复杂格式的流式解析有参考价值,特别是涉及多工具调用场景时。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复Qwen25模型流式多工具调用解析失败问题。
建议工程师精读此PR,关注解析逻辑中的错误处理模式和回退机制设计,这对于处理复杂格式的流式解析有参考价值,特别是涉及多工具调用场景时。
融合温度缩放与softmax采样内核,减少解码延迟。
建议工程师精读`fused_sampling.py`以学习Triton内核设计和自动调优策略,关注条件阈值选择和预热机制。性能优化显著,适用于性能敏感场景,值得作为内核优化案例参考。
原始 PR · 作者 Kangyan-Zhou · 合并时间 2026-04-02 12:41
在Trivy安全扫描中跳过Go标准库和NVIDIA工具目录,消除约500个不可修复的误报警报。
该PR变更简单直接,无需深入技术分析。建议关注点:1) 了解Trivy skip-dirs配置的使用场景;2) 注意基础镜像依赖带来的安全扫描噪音问题;3) 可作为类似CI配置优化的参考案例。
将多线程权重加载默认值从False改为True,提升模型冷启动性能。
该PR变更简单但影响默认行为,建议团队关注CI测试结果,确保无回归。对于深入理解模型加载优化,可结合Issue #12529中的其他改进方案(如Runai streamer集成)一起阅读。
为HiCache文件后端添加流水线并行(PP)键支持,扩展存储配置命名空间。
建议关注此PR作为HiCache支持流水线并行的第一步。虽然变更本身简单,但需要理解其在整个兼容性解决方案中的定位。重点关注配置后缀生成逻辑的变化,以及后续PR如何在此基础上构建完整功能。
将所有调用者从弃用的/get_server_info迁移到新的/server_info端点,清理API表面。
建议开发团队快速浏览此PR,关注API清理的最佳实践和弃用管理。对于新贡献者,理解如何管理端点弃用是有价值的学习案例。变更直白,无需深度技术分析,但值得参考以确保未来类似重构的顺利进行。
为B200 GPU添加NVFP4量化扩散模型CI测试路径。
建议CI维护者和测试工程师精读此PR,关注CI job配置、测试套件设计以及性能基线更新策略,这些决策对后续硬件扩展有借鉴意义。
原始 PR · 作者 Kangyan-Zhou · 合并时间 2026-04-02 11:27
移除导致夜间测试崩溃的Kimi K2.5 MTP变体,保留TP8和TP8+DP8配置。
该PR值得快速浏览,以了解CI测试配置的调整。关注点:1) 移除MTP变体的具体原因(OOM和未知错误);2) 新增TP8+DP8变体的配置;3) 测试覆盖范围的变化。对于负责CI或测试的工程师,建议检查是否有其他测试需要类似调整。
参与讨论