Prhub

sgl-project/sglang · 标签视图

标签列表

聚合结果

mlx 相关 PR

2026-08-10
功能 重要性 9.36 洞察度 9.00

MLX 后端窗口化 SWA KV 存储并新增图内采样

值得精读。这是 MLX 后端迄今最重要的 PR 之一,建议重点关注三个设计决策: 1. **图内 Gumbel-max 采样如何与 overlap 调度器共存**——chaining 属性保住了 0.05-1.2 ms/step,而 body 诚实披露采样本身在 batch 64 时要 0.5-24 ms/step,这个取舍框架可以直接借鉴; 2. **SWA 前缀全量重算的取舍**——用精确性论证代替启发式优化,并明确标注"后续 SWARadixCache 恢复快速命中"的演进路径; 3. **bounded top-K 链与 murmur hash 移植**——把 CUDA 语义搬到 `mx` 平台时如何保持 seeded 行与 batch 组成无关的契约。 同时注意其性能数字都是低并发 Apple Silicon 本地 serving 场景,推广到高并发服务前需重新验证。

2026-07-24
缺陷修复 重要性 4.00 洞察度 4.00

修复MLX模型因量化配置缺失导致启动失败

作为典型的防御式编程修复,值得所有涉及字典键访问的代码参考。建议合入后关注是否有其他覆盖方法存在类似问题。

2026-06-24
2026-06-04
缺陷修复 重要性 7.20 洞察度 6.00

修复 MLX 后端 canary_manager 缺失和 overlap loop 输入未物化崩溃

该 PR 值得阅读,尤其对于理解 SGLang 调度器中硬件后端抽象(FutureMap、canary_manager)的设计和演进。展示了一个小而优雅的修复:通过添加类属性和调整初始化顺序避免重写整个基类流程。同时,与 #26952 的对比体现了不同修复策略的权衡。

2026-04-18

#21509 [MLX] Support radix cache

原始 PR · 作者 yeahdongcn · 合并时间 2026-04-18 07:00

功能 重要性 9.18 洞察度 6.00

为 MLX 后端添加基数缓存,提升共享前缀工作负载的预填充吞吐量。

该 PR 值得精读,特别是关注基数缓存与调度器的集成设计、MLX 原生内存管理策略(如自动池大小计算)以及批处理解码的实现权衡。建议工程师在类似后端扩展时参考其模块化设计(如分离 KV 池、缓存类和注意力包装器),但需注意测试覆盖和架构兼容性的不足。