修复SWA模型输入长度限制过严问题,允许大于SWA池但小于全池的输入长度。
该PR值得精读,特别是对于处理SWA模型或调度系统的工程师。值得关注的设计决策包括:1. 将SWA预算计算从简单的`min()`限制重构为显式偏移跟踪;2. `_swa_budget_for_req`方法中考虑分块预填充和滑动窗口保留的逻辑;3. 保持向后兼容性的同时修复功能限制。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复SWA模型输入长度限制过严问题,允许大于SWA池但小于全池的输入长度。
该PR值得精读,特别是对于处理SWA模型或调度系统的工程师。值得关注的设计决策包括:1. 将SWA预算计算从简单的`min()`限制重构为显式偏移跟踪;2. `_swa_budget_for_req`方法中考虑分块预填充和滑动窗口保留的逻辑;3. 保持向后兼容性的同时修复功能限制。
为混合SWA模型添加运行时繁忙内存检查支持,修复NotImplementedError。
该PR值得内存管理和调度器模块的工程师精读,特别是关注`_get_total_uncached_sizes`中双池未缓存令牌的计算逻辑,以及`_self_check_during_busy_swa`中双池守恒不变性的设计。对于使用SWA模型的团队,建议验证新检查在各自场景下的行为。
为GLM-5模型在AMD平台优化Aiter稀疏注意力性能,通过填充头数和移除硬编码参数。
建议AMD平台开发者或关注GLM-5性能优化的工程师精读此PR。重点关注头数填充的设计决策(need_pad_heads和head_repeat_factor),以及如何优雅地适配内核约束而不破坏原有逻辑。同时注意此PR暂未合并,需跟踪相关Aiter更新。
原始 PR · 作者 hubertlu-tw · 合并时间 2026-04-12 14:47
修复AMD平台融合allreduce阈值并移除hidden_dim白名单,简化维护。
该PR值得精读,特别是parallel_state.py中移除白名单的设计决策,展示了如何将策略下放至底层内核以简化上层逻辑;同时,测试文件中的残差精度检查函数是验证数值正确性的良好范例,有助于理解融合allreduce的准确性保障。
原始 PR · 作者 JustinTong0323 · 合并时间 2026-04-12 14:15
Whisper模型编码器从串行改为批量执行,提升高并发预填充吞吐量。
该PR值得精读,尤其是对于关注模型推理性能优化的工程师。关键设计决策包括:1) 识别编码器为瓶颈并量化其开销;2) 利用编码器天然的批次兼容性实现无交互的批量执行;3) 输出重塑策略以适配下游KV缓存。建议结合基准测试数据理解不同硬件平台上的收益差异。
原始 PR · 作者 ZhaiFeiyue · 合并时间 2026-04-12 14:07
修复预填充输入吞吐量日志计算错误,消除虚假TPS峰值。
该PR值得快速浏览,特别是对于关注监控指标准确性的工程师。关键设计决策是将预填充吞吐量计算与解码阶段逻辑对齐,体现了指标计算的一致性原则。虽然变更简单,但PR描述中的历史演进分析具有教育价值。
消除非增量流式输出中的O(n²)复制开销,显著提升长序列生成性能。
该PR值得精读,特别是对于关注性能优化和流式输出实现的工程师。关键设计决策包括:1. 基于性能剖析数据驱动优化;2. 安全地传递引用而非复制,依赖于asyncio单线程假设;3. 延迟文本生成以避免每步O(n)字符串重建;4. 将路径拆分为三种情况以平衡正确性和性能。建议关注`_handle_batch_output`中的条件分支逻辑和`_wait_one_response`中的延迟解析实现。
引入动态负载均衡分区机制,优化扩散模型 CI 测试的平衡性和总运行时间。
建议工程师精读此 PR,关注 LPT 算法在 CI 分区中的应用设计,以及如何通过动态估算时间优化资源分配。对于 CI 维护者,值得参考其模块化设计,但需注意新增脚本的稳定性和估算时间的准确性。
参与讨论