为FLUX和Wan2.2扩散模型添加ModelOpt FP8支持,提升推理性能并提供可重用工作流。
该PR值得精读,特别是`modelopt_quant.py`中的量化配置设计和`transformer_load_utils.py`中的适配器逻辑,展示了如何处理FP8权重的特殊布局要求和自动禁用offload的设计权衡。关注转换工具的通用性设计和验证工具的方法学。
SGLang is a high-performance serving framework for large language models and multimodal models.
为FLUX和Wan2.2扩散模型添加ModelOpt FP8支持,提升推理性能并提供可重用工作流。
该PR值得精读,特别是`modelopt_quant.py`中的量化配置设计和`transformer_load_utils.py`中的适配器逻辑,展示了如何处理FP8权重的特殊布局要求和自动禁用offload的设计权衡。关注转换工具的通用性设计和验证工具的方法学。
修复 GDN 内核以支持非连续 B/A 张量输入,解决 Qwen3.5-27B 准确性回归问题。
建议工程师精读此 PR,以学习内核中处理非连续内存布局的技术细节,以及如何通过显式步幅参数扩展内核通用性。关注测试文件中的模拟方法,可作为类似场景的参考。
预分配GDN验证路径索引,优化推理性能。
该PR值得快速浏览,了解GDN后端性能优化的常见模式——通过预分配减少动态开销。关注`req_to_token_pool.size`的稳定性,以及验证路径中索引重用的设计决策。
原始 PR · 作者 ShangmingCai · 合并时间 2026-04-10 17:52
为HiCache添加注意力上下文并行(CP)支持,确保缓存键正确生成。
建议技术管理者和工程师精读此PR,特别关注`mooncake_store.py`中的缓存键生成逻辑和设计讨论。这有助于理解在异构并行设置下如何维护缓存一致性。
为长上下文预填充请求添加待处理令牌数监控指标,增强调度器可观测性。
该PR值得精读,重点关注_get_num_pending_tokens()中chunk_deduct参数的设计,它巧妙处理了调度时间(prefix_indices未更新)和查询时间(prefix_indices已更新)的时间差问题,体现了对调度器内部状态同步的深刻理解。
新增 FlashInfer CuteDSL 作为 FP4 MoE 标准路径后端,支持 EP=1/TP 配置。
建议技术管理者和工程师精读此 PR,重点关注:1) `flashinfer_cutedsl.py` 中的尺度解析和权重预处理逻辑,涉及量化细节;2) 设计决策如默认 runner 设置和 EP 处理;3) 测试覆盖是否充分,尤其是端到端准确性验证。
修复 Flux.2 模型 TI2I 准确性,通过对齐编码器、VAE 和图像预处理行为。
建议工程师精读此 PR,特别是 flux.py 中的 normalize_vae_encode 方法和 test_input_validation.py 中的测试案例,以理解如何对齐模型组件与官方实现。关注设计决策如使用特定图像处理器和归一化策略,这些对于维护多模态模型准确性有借鉴意义。
修复SWA准入检查中页面大小预算不一致导致的过度准入问题。
该PR值得精读,尤其关注SWA内存预算管理中的页面对齐开销处理。设计决策简单直接,但揭示了预算检查与实际扣除一致性的重要性。建议工程师理解`_update_prefill_budget`与`add_one_req`的协作逻辑,以及页面大小在内存分配中的作用。
参与讨论