修复PCG模式下注意力填充令牌计算问题,避免未定义行为和输出损坏。
该PR值得精读,特别是radix_attention.py和radix_linear_attention.py中的切片逻辑设计,展示了如何在保持原有batch对象身份的同时排除填充令牌。建议关注out_cache_loc的动态修改和恢复机制,以及讨论中关于字段命名和缓冲区初始化的技术权衡。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复PCG模式下注意力填充令牌计算问题,避免未定义行为和输出损坏。
该PR值得精读,特别是radix_attention.py和radix_linear_attention.py中的切片逻辑设计,展示了如何在保持原有batch对象身份的同时排除填充令牌。建议关注out_cache_loc的动态修改和恢复机制,以及讨论中关于字段命名和缓冲区初始化的技术权衡。
原始 PR · 作者 michaelzhang-ai · 合并时间 2026-04-14 15:30
为AMD平台添加MiniMax-M2.7准确性及性能夜间CI测试,替换M2.5并修复导入bug。
建议工程师精读CI工作流变更逻辑,了解如何替换模型测试作业;关注minimax_m2.py的导入修复,作为关键bugfix的范例;测试文件可作为添加新模型测试的模板,适合学习SGLang的测试框架结构。
原始 PR · 作者 xiaobochen-amd · 合并时间 2026-04-14 15:25
修复fp8 aiter预填充内核输出数据类型不匹配导致的模型输出损坏问题。
该PR值得快速浏览,了解fp8 kv-cache在AMD平台上的数据类型处理细节。关注点:1) 类型转换的触发条件(`if o.dtype != self.input_dtype`)是否足够健壮。2) 考虑HaiShaw关于“inbound”类型检查的建议是否需要在其他位置实施。
为扩散模型添加FLUX.1-dev ModelOpt NVFP4支持,提升推理性能22.9%。
该PR值得精读,特别是关注NVFP4集成设计、量化配置灵活性和性能优化策略。建议关注以下设计决策: 1. `swap_weight_nibbles`配置如何平衡不同导出格式的兼容性。 2. JIT预热机制在torch.compile环境下的优化作用。 3. transformer组件加载逻辑的修改如何避免全局覆盖冲突。
为GB200夜间流水线添加手动触发时可选的自定义Docker镜像参数。
该PR变更简单直接,适合快速浏览以了解CI工作流扩展模式。对于关注CI/CD基础设施或GB200测试流程的工程师,可关注如何通过inputs参数增强工作流灵活性。无需深入代码分析。
修复 GLM-5/5.1 MXFP4 量化检查点在 SGLang 中的推理兼容性问题。
该 PR 值得精读,特别是对于处理量化模型加载和 DeepSeek 架构的工程师。关注点包括:1) `packed_modules_mapping` 在模型加载中的通用设计模式;2) 条件检查如何精准隔离架构特定的量化处理逻辑,避免副作用;3) 从 review 讨论中学习代码结构一致性和防御性编程的最佳实践。
修复CI中flashinfer-jit-cache在CUDA版本不匹配时未重新安装的问题。
该PR变更简单明确,适合快速浏览以了解CI环境管理细节。值得关注的点:1. 如何从包版本字符串中提取CUDA后缀的sed技巧。2. CI缓存管理中的版本匹配策略,可作为类似场景的参考。
原始 PR · 作者 yctseng0211 · 合并时间 2026-04-14 13:33
将AMD CI工作流从push触发改为调度触发,并优化阶段执行策略以减少资源压力。
建议CI维护者和AMD平台开发者精读此PR,关注并发控制逻辑和错误处理机制,特别是 `check-changes` 作业的条件判断和 `continue_on_error` 设置,这些设计决策有助于优化CI资源管理和稳定性。
参与讨论