Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 21:57 同步状态:空闲 下次计划:2026-09-02 22:57

PR 列表

更多筛选
2026-08-21
重构 重要性 6.53 洞察度 5.00

清理 disagg 模块 4 处无调用死代码,纯删除零行为变化

值得快速浏览,不是因为它改变了什么,而是因为它示范了“如何安全地删除代码”:每个删除项都给出来源 commit、存活替身、全仓库扫描证据、lint 验证,并明确区分死代码与扩展点。对维护者而言,真正可借鉴的是 page_indices_to_cp_rank_page_indices 被孤儿化的过程——重构时把调用方迁移到新实现后应顺手清理旧符号,避免正确性修复落在无人调用的代码上。若团队有 dead code 治理需求,本 PR 可作为模板。

功能 重要性 9.00 洞察度 5.00

新增确定性 LoRA 权重源解析

值得精读。该 PR 展示了一个小而美的抽象:将权重源解析独立成模块,并通过 fail-closed 策略控制行为确定性,同时主动收窄 PR 范围(删除早期尝试的 preflight CLI 等),是控制变更风险的范例。

缺陷修复 重要性 6.12 洞察度 6.00

修复映射权重存储被占位符覆盖的bug

值得精读,因为揭示了PyTorch中`Tensor.data`原地替换存储的陷阱以及如何通过独立视图规避。设计决策:使用`detach().view_as`而非`clone`以保持零拷贝。建议关注此bug对其他offload路径的影响。

重构 重要性 5.71 洞察度 3.00

移除无调用的 get_embedding_port 及其 aiohttp 依赖

本 PR 价值有限,无需精读。若关注代码库整洁性,可借鉴其按文件拆分死代码清理、逐文件审查的模式。关键设计决策是通过仓库级检索确认无调用者,避免误删潜在接入点。

性能优化 重要性 7.77 洞察度 6.00

SANA-Video high 档线性注意力新增 BF16 快路径,提速约 5%

值得精读。核心看点:`try_sana_video_linear_attention` 的多条件 guard 与回退设计、`QualityGatedFusion` 的请求级挂载复用、以及如何在保持默认路径逐位一致的前提下为单个质量档开放 BF16 加速。建议顺带检查 `torch.bmm(out_dtype=...)` 的最低版本要求,并考虑把模型级 A/B 验证固化到 CI。

#35724 [diffusion] Enable LongCat breakable CUDA graphs

原始 PR · 作者 BBuf · 合并时间 2026-08-21 17:59

功能 重要性 7.55 洞察度 5.00

为 LongCat-Image 启用可中断 CUDA Graph,端到端提速约 3.4%

值得精读。核心价值不在改动量,而在于"模型固定 prompt 形状时用 pass-through padder 绕过通用 bucket padding"的设计决策,以及 BCG 按分辨率捕获、未命中回退 eager 的运行时契约。对有意给 diffusion 模型接入 BCG 的工程师,`longcat_image.py` 与 `server_args.py` 的白名单机制是最小可复用范例。

#35748 Fix overlap prebuilt row reuse race

原始 PR · 作者 jasonjk-park · 合并时间 2026-08-21 17:00

缺陷修复 重要性 6.99 洞察度 6.00

修复 overlap 预构建行复用竞态,调度流等待前向流

值得精读。该 PR 修复的是调度核心路径上的竞态条件,涉及流同步和 FutureMap 的共享状态管理。理解其修复思路(通过显式流等待代替事件链)对处理类似并发问题有参考价值。此外,其测试编写方式(使用 mock 验证调用顺序)也值得学习。

参与讨论