Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 19:08 同步状态:空闲 下次计划:2026-09-01 20:08

PR 列表

更多筛选
2026-08-29
性能优化 重要性 6.72 洞察度 7.00

调优 DSv4 split-K 启发式,MI355X 解码内核提速 20.8%

值得精读。这是一个小而完整的性能调优案例:用几何平均遗憾量化启发式偏差、识别 CUDAGraph 捕获期无法感知 per-token K 的根本限制,并用契约测试固定不变量而非数值。对 AMD 性能工作和 attention 内核开发者有直接参考价值,尤其是 `test_tuned_operating_points` 显式传参跨运行器的做法。

缺陷修复 重要性 5.81 洞察度 5.00

修复 /rerun-test 对非 CUDA 后端注册的误报

值得略读,属于低风险修复,但展示了 CI 工具链中注册信息与调度逻辑的耦合。关注点:1) 如何通过共享数据结构(REGISTER_MAPPING)来避免硬编码后端列表;2) 考虑将 AMD 等工作流纳入 /rerun-test 的调度范围,以彻底消除此类误导。

缺陷修复 重要性 7.42 洞察度 7.00

为 Blackwell MegaMoE 默认保留 2 个 SM,修复 grid sync 超时

值得精读。核心看点:一是用 contextmanager 把进程级 `set_num_sms` 的修改限制在单个 kernel 调用并保证异常恢复;二是缓存键与 launch SM 数解耦,避免无谓的大 buffer 重分配;三是从物理 SM 数推导而非 `deep_gemm.get_num_sms()`,避免与 DSA indexer 的进程级改写叠加扣减。建议 Blackwell 部署团队验证默认保留 2 个 SM 的效果,并关注后续是否补充自动化回归测试。

缺陷修复 重要性 6.68 洞察度 5.50

修复批处理请求状态提前释放导致的 KeyError,改为预解析状态

建议精读,该 PR 展示了异步生成器生命周期与状态管理的经典陷阱,值得学习。设计决策:将状态解析提前到生成器构建时,避免状态失效。

基础设施 重要性 4.71 洞察度 3.00

新增 gfx1250 每日发布作业,从 amd_helios 分支构建镜像

该 PR 为基础设施变更,代码量小,逻辑清晰。可快速浏览,重点了解新增作业的独立性和版本标记策略。

缺陷修复 重要性 6.27 洞察度 5.00

HiCache 加载回写增加前向流栅栏,修复数据竞争

此 PR 值得精读,因为它展示了并发控制中流同步的正确用法,以及如何在不改变计算逻辑的情况下解决数据竞争。值得关注的设计决策包括使用实例属性而非类级属性、将前向流引用注入控制器、以及测试 mock 的调整方式。对于涉及缓存并发控制或流同步的开发者有参考价值。

缺陷修复 重要性 6.47 洞察度 5.00

HiCache 存储预取改按请求命名空间定键,修复双重释放

值得精读,尤其是两个设计决策:预取键的命名空间应从请求而不是 anchor 派生(anchor 无命名空间),以及用断言让不一致场景大声失败而不是静默降级。建议后续补充一个多租户 + 分层缓存 + L3 存储的端到端测试,验证修复后的预取命中与无 double-free;同时确认调度器 `_prefetch_kvcache` 路径上的断言异常不会中断调度循环。

重构 重要性 9.01 洞察度 6.00

移除 ServerArgs 转发槽位,调度器直连钩子函数

值得精读,尤其是导入放置和 AST 测试设计。作者对重构的边界处理非常细致:区分真正入口与转发产物,按实际签名映射参数,并用源码级 AST 测试钉死延迟导入约束。对于大型类逐步外移逻辑的重构,这是一个很好的参考模板。

参与讨论