固定 maturin 版本 <1.14 修复 AMD Docker 构建
值得合并,属于阻塞性修复。建议后续跟踪 maturin 1.14.x 的问题,并在修复后解除版本锁定。
SGLang is a high-performance serving framework for large language models and multimodal models.
固定 maturin 版本 <1.14 修复 AMD Docker 构建
值得合并,属于阻塞性修复。建议后续跟踪 maturin 1.14.x 的问题,并在修复后解除版本锁定。
优化 FLUX.1 的 TP 分片,2GPU 延迟降低 35%
PR 的核心设计决策(保留 Nunchaku 路径、权重分片加载)值得关注,适合对扩散模型 TP 优化感兴趣的工程师精读。mask 注意力 GQA 修复和 overlay 缓存完善也具有通用参考价值。
为 Mooncake Embedding Cache 添加 LRU 淘汰机制
该 PR 值得精读,尤其是引用计数设计、锁策略以及与 RDMA 异步操作的交互。展示了如何在缓存系统中安全地添加逐出而不破坏在途 I/O,对类似系统的缓存实现有参考价值。
清理推测解码 V1 残留死代码
建议快速审查当前 PR 确认无遗漏;对 speculative 架构演进感兴趣的开发者可结合 #27977 一起阅读,理解 V1→V2 的过渡细节。
为 Ascend NPU 添加 Gemma4 SWA 支持
该 PR 是 Ascend NPU 后端支持混合滑动窗口注意力的重要里程碑,涉及 mask 生成、图模式支持、回退路径增强、语义对齐等多层面改动。代码质量较高,设计决策清晰(如窗口约定转换、图模式预分配策略),评测数据充分。建议关注 SWA 路径在图模式下的性能表现和测试覆盖的持续性。值得精读,尤其是 `ascend_backend.py` 中 `_init_cuda_graph_metadata` 的 mask 更新逻辑和 `ascend_torch_native_backend.py` 的窗口裁剪实现。
修复 NVFP4 量化使用错误的 flashinfer 接口
该 PR 是典型的微调修复,技术复杂度低,但解决了实际运行中的量化分支错误。建议 CI 增加对 cute-dsl 后端的量化测试。
原始 PR · 作者 vincentzed · 合并时间 2026-06-12 11:08
添加 LiquidAI LFM2.5 部署文档与基准配置
建议读者重点了解 config-driven 的 cookbook 实现模式,以及如何通过 snippets 和组件统一管理模型配置和基准数据。关注 LiquidAI 模型的用户可直接参考该页面了解部署细节和性能表现。
原始 PR · 作者 AgainstEntropy · 合并时间 2026-06-12 11:05
get_default_distributed_backend 委托平台接口
值得所有涉及分布式初始化和平台插件的开发者精读。本 PR 展示了如何将核心组件迁移到插件友好接口而不破坏向后兼容。重点关注委托决策与 fallback 机制。
参与讨论