为注意力张量并行和上下文并行组启用消息队列广播,统一环境变量读取方式。
该PR变更较小但涉及分布式通信核心逻辑,建议相关开发者关注环境变量读取方式的统一化。对于正在使用或计划使用_ATTN_TP/_ATTN_CP广播功能的团队,需要验证变更后的行为是否符合预期。
SGLang is a high-performance serving framework for large language models and multimodal models.
为注意力张量并行和上下文并行组启用消息队列广播,统一环境变量读取方式。
该PR变更较小但涉及分布式通信核心逻辑,建议相关开发者关注环境变量读取方式的统一化。对于正在使用或计划使用_ATTN_TP/_ATTN_CP广播功能的团队,需要验证变更后的行为是否符合预期。
原始 PR · 作者 JustinTong0323 · 合并时间 2026-04-11 11:37
修复工具调用约束解码与解析,确保原生格式模型在required模式下正确使用structural_tag并强制至少一个调用。
该PR值得精读,特别是`function_call_parser.py`中的`get_structure_constraint()`方法设计,展示了如何权衡模型原生格式与OpenAI协议要求。关注`at_least_one`标志的引入和`supports_structural_tag()`检查的逻辑,这对理解约束解码机制有重要价值。
引入PoolStats数据类统一内存池指标统计,消除重复代码。
该PR值得精读,尤其对于关注代码重构和内存管理设计的工程师。可重点学习如何使用数据类封装复杂逻辑,以及如何通过统一入口简化调用点,提升代码可读性和维护性。
删除冗余的页面大小测试文件,其功能已被更全面的EAGLE测试覆盖。
该PR变更简单,无需深入精读。对于团队来说,值得关注的是测试覆盖的优化策略,即识别并删除冗余测试以提升CI效率。建议在类似清理操作中确保有明确的覆盖验证(如PR body中的测试计划),以避免意外丢失测试场景。
启用GPU图像预处理,显著降低Kimi-K2.5模型的首次令牌生成时间。
建议工程师精读kimi_k25.py中的GPU处理函数(如navit_resize_config和_process_single_image),学习图像预处理的GPU加速设计;关注review中讨论的冗余检查和内存管理问题,以改进代码质量。
原始 PR · 作者 happierpig · 合并时间 2026-04-11 10:27
修复CUDA Graph捕获时num_token_non_padded计算逻辑,确保捕获与重放行为一致。
建议CUDA Graph和attention TP相关开发者精读此PR,理解捕获与重放路径对齐的设计决策。关注条件判断逻辑和compute_local_num_token_non_padded函数的实现,确保在不同配置下行为正确。
改进扩散模型CI测试可读性并修复早期返回bug。
建议技术管理者和工程师精读run_suite.py的重试机制设计,理解如何平衡测试稳定性和准确性,并关注对早期返回bug的修复以避免类似问题。同时,review讨论中的OOM检测改进值得后续跟踪。
原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-04-11 09:58
为用户lawrence-harmonic添加CI权限配置,允许其触发CI测试和重试失败任务。
该PR变更简单直接,无需深入阅读。对于了解CI权限管理机制的工程师,可快速浏览以熟悉配置格式;对于其他人员,可忽略。
参与讨论