Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 23:02 同步状态:空闲 下次计划:2026-09-03 00:02

PR 列表

更多筛选
2026-07-27
缺陷修复 重要性 6.77 洞察度 6.00

修复 Mooncake 多 TP rank 并发 /send 的内存竞争

建议精读此 PR,尤其是请求级共享 MR 的 lazy registration 模式和 embedding 生命周期管理,可作为编码中解决并发资源竞争的范例。

#32489 Add local ZIP uploader for whl releases

原始 PR · 作者 Fridge003 · 合并时间 2026-07-27 15:04

功能 重要性 7.17 洞察度 5.00

新增本地 ZIP 上传器,自动化 whl Release 发布与索引更新

值得精读 shell 脚本中的幂等设计和 Python 索引更新逻辑,可作为自动化发布工具的实现参考。但注意测试覆盖被移除,建议在生产前补充 CI 中的集成测试。

功能 重要性 7.94 洞察度 6.00

新增 opt-in 扁平 top logprobs 响应格式,序列化性能提升 1.9 倍

值得精读。该 PR 以极小侵入性实现了显著的序列化性能提升,设计决策清晰(opt-in、null_prefix 处理、缓存复用),且与后续优化形成递进路径。可作为服务端响应格式优化的参考案例,尤其适合对序列化开销敏感的团队借鉴。

缺陷修复 重要性 7.55 洞察度 5.00

修复 HiCache 预取挂载破坏 backup 不变量导致的调度器崩溃

值得精读。亮点在于:1) 对“两个崩溃症状、一个根因”的剖析方式非常清晰,可作为缓存不变量类 bug 的排查范式;2) “简单丢弃而非修补”的决策展示了最小化复杂度原则——放弃一次 best-effort 优化换取结构不变量的强保证;3) review 中 write-through/write-back 语义区分提醒读者策略条件的重要性;4) rebase 中发现的同构非法状态测试(#29901)是理解 radix-tree 不变量边界的绝佳案例。建议同步关注 #31812 解除跳过后回归测试的恢复情况。

功能 重要性 8.83 洞察度 6.00

支持 LoRA 在 breakable prefill CUDA graph 下运行,显著加速短输入

此 PR 是高质量变更,设计干净、测试充分。建议阅读核心设计模式:静态预分配 + 原位刷新,这是将 CUDA graph 与动态特性(如 LoRA)兼容的通用方法。同时,其 `can_use_prefill_cuda_graph` 和 `prepare_lora_batch` 的一致性设计值得借鉴。对于 LoRA 相关开发者,此 PR 是必读。

#31992 fix(hisparse): correct DSA KV memory budget

原始 PR · 作者 daii-0818 · 合并时间 2026-07-27 11:19

缺陷修复 重要性 7.63 洞察度 5.00

修复 HiSparse DSA KV 内存预算与实际分配不匹配

建议关注 `_compute_cell_size` 与 `DSATokenToKVPool` 以及 `calculate_mla_kv_cache_dim` 的契约关系。本 PR 展示了如何利用已有分配函数来保障预算准确性,是内存生命周期管理的最佳实践。值得精读以避免类似内存偏差问题。

#32375 model: support EmbeddingGemma

原始 PR · 作者 mickqian · 合并时间 2026-07-27 10:40

功能 重要性 8.67 洞察度 7.00

支持 EmbeddingGemma 模型,集成双向注意力与 Breakable CUDA Graph

值得精读:本 PR 展示了如何利用现有模型骨架(Gemma3)快速实现编码器变体,并巧妙通过条件注意类型实现注意力重用,以及通过 server_args 的后期处理阶段完成模型特定的 BCG 配置。均值池化的 cumsum 实现也是一个简洁的批量池化示例。

参与讨论