Prhub

sgl-project/sglang · 标签视图

标签列表

聚合结果

apple-silicon 相关 PR

2026-09-02
缺陷修复 重要性 3.30 洞察度 2.00

为 MLX 测试模拟对象添加缺失属性,修复 CI 测试失败。

这是一个简单、明确且必要的 bugfix,用于修复一个由先前 PR 引入的测试基础设施回归。PR 改动范围小(1 行代码),动机清晰,且已通过 CI 验证。虽然技术洞察有限,但它及时修复了阻塞 CI 的问题,因此值得肯定并合并。主要关注点在于验证修复是否完全解决了测试失败问题。

2026-08-19
性能优化 重要性 9.00 洞察度 6.00

H3 MPS 内存优化:权重分阶段卸载、前向分块流式

值得精读,尤其 `_forward_mps_streamed_attention` 是“分块流式计算规避统一内存峰值”的典型范例,LayerwiseOffloadManager 对同步/异步双路径的抽象也有借鉴价值。阅读时建议对照 commit 历史中多次 revert 的 chunk size 调参过程,理解 MPS 内存-吞吐权衡的敏感性;但由于 Draft 合并且 CI Extra 失败,合入后应优先补齐端到端精度验证,再在真实 MPS 设备上推广。

2026-08-12

#34262 [Feature] Add Muse Glimmer model support

原始 PR · 作者 sglang-bot · 合并时间 2026-08-12 06:41

功能 重要性 9.36 洞察度 8.00

新增 Muse Glimmer 模型原生支持,覆盖 CUDA 与 MLX 双后端

值得精读。重点看三处设计:一是 `muse_glimmer_mlx.py::sanitize()` 对三种 checkpoint 布局的判别与变换(offset norm 折叠、q/gate per-head interleave、位置性 norm 重命名),这是处理 vendor 私有格式的范例;二是 `MuseGlimmerDetector` 的 `preserve_channels` 机制,解决被引用的工具标记与真实工具调用的歧义,对流式解析器设计有借鉴意义;三是 `remote_code_gate.py` 在 mlx-lm 无 trust_remote_code 参数的情况下前置安全检查的思路。

2026-08-11
测试 重要性 4.88 洞察度 4.00

用 patch 固定 use_mlx,修复 MLX CI 车道 profiler 测试误走策略

值得快速浏览:变更短小,但“环境变量被 `lru_cache` 缓存打败、因此在调用点 mock”这一测试隔离模式有通用借鉴意义。关注点放在 `setUp` 的 patch 目标路径与 `addCleanup` 的组合用法,以及 docstring 中记录的设计理由。

2026-08-10
功能 重要性 9.01 洞察度 7.00

MLX 后端支持 gpt-oss:滑动窗口注意力、attention sinks、sm_scale

值得精读。关注三个设计决策:一是“读取时应用窗口 vs 旋转缓存”的取舍——保留完整 KV 并用 banded mask/尾部截断,在 softmax 下数值等价且不破坏 radix 前缀复用,代价是显存冗余,这是很实用的权衡;二是测试防假阳性设计——刻意要求提示词 >128 token 保证窗口真正参与,否则短提示词下窗口层和全注意力输出相同、测试会空过;三是 AOT 内核门控的 fail-safe 策略——宁可回退到 `mx.fast.rope` 也绝不用 vanilla 内核算错 scaled RoPE。做平台后端或注意力系统的人可参考其中的契约设计与测试方法论。

2026-07-29
缺陷修复 重要性 7.75 洞察度 6.00

修复 MLX overlap 调度器首请求崩溃与优雅退出

该 PR 修复了 MLX 后端两个隐蔽但影响严重的问题,值得相关开发者精读,尤其是 `_prepare_mlx_launch` 的设计及其与 `run_batch` 的对齐方式,以及优雅退出的处理。Review 讨论中对 launch_ts 放置位置和 SWA 维护的权衡也值得参考。

2026-07-17
缺陷修复 重要性 8.24 洞察度 7.00

修复 MLX 后端忽略 max-running-requests 问题

建议精读。该 PR 不仅修复了一个长期存在的参数失效 bug,还通过 review 迭代完善了辅助状态池的边界处理与释放所有权,体现了良好的设计权衡。测试完备,代码质量高。