Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 17:58 同步状态:空闲 下次计划:2026-09-01 18:58

PR 列表

更多筛选
2026-08-22
重构 重要性 6.01 洞察度 5.00

提取 _all_reduce_polls 统一三处 MIN all_reduce 逻辑

改动很小,但值得作为“安全重构分布式 collective 代码”的范例阅读:先点明不变量、明确不相关函数(poll_and_all_reduce_pp)的边界、用调用日志级等价性验证而非目测。建议关注两点:一是三类轮询路径的语义差异(staging 降级、metadata 门控、两段式同步)如何被保留;二是验证脚本未入库这一遗留改进点。

缺陷修复 重要性 4.92 洞察度 4.00

修复 gRPC 流式请求在归一化前取字段导致的崩溃

值得精读。虽然改动只有几行,但它揭示了异步生成器初始化与请求归一化之间的隐性时序契约,以及“循环不变量上提”这类清理操作可能引入的回归模式。对入口层、gRPC bridge 或异步流水线的维护者尤其有参考价值。

缺陷修复 重要性 7.10 洞察度 7.00

修复自定义编码器下 Anthropic 历史思考标记泄漏

值得精读。三点设计值得借鉴:一是从渲染产物反推根因——用修复前后经真实 tokenizer 的渲染对照定位频道错位,而不是只看解析器行为;二是契约用 `spec is not None` 覆盖整个编码器家族并明确安全默认方向(丢弃优于泄漏),避免未来新增编码器踩同样的坑;三是用源码解析守卫测试把“新增编码器必须分类”变成 CI 硬约束并做 mutation-check。若后续增强,建议补 dsv4 / dsv32 / inkling 的端到端多轮回归,并把 `reasoning_content` 的双向验证收进契约测试。

2026-08-21

#25122 Restructure mem_cache auto-labels by layer

原始 PR · 作者 alphabetc1 · 合并时间 2026-08-21 23:30

基础设施 重要性 4.21 洞察度 5.00

重构 mem_cache 自动标签,按池 / radix / 主机三层拆分

值得快速浏览。如果要扩展 labeler 规则,本 PR 提供了两个可借鉴的设计决策:用目录 glob 而非显式文件列表以抵御目录迁移;按子系统所有权而非文件名子串组织匹配。对于关注 HiCache / 缓存层演进的读者,重点是 ispobock 的合并说明与 RFC #25371 的关系,以及 `memory-pool` 与 `unified-radix-cache` 两个新标签组如何为未来的 mem_cache 拆分铺路。

#35868 [diffusion] Preserve PEFT LoRA semantics

原始 PR · 作者 mickqian · 合并时间 2026-08-21 22:58

功能 重要性 8.96 洞察度 6.00

新增 PEFT LoRA 语义支持,fail-closed 拒绝无法表示的语义

值得精读。关注 `peft_adapter.py` 的 fail-closed 设计、`normalize_peft_keys` 的前缀/槽位处理、`scale_fused_sections` 对融合 section 的逐层 alpha 实现,以及如何在不新增 CLI 的情况下读取 `adapter_config.json`。

缺陷修复 重要性 8.38 洞察度 6.00

全局 attention-backend 对辅助组件回退默认后端

值得精读。核心价值在于 `get_attn_backend()` 对“全局 CLI 选择 vs 组件级 override”的语义区分,以及 `is_cross_attention` 角色在多层注意力封装间的显式传播——这是多组件扩散管线中后端选择与安全回退的典型设计模式。建议重点阅读 `selector.py` 的回退分支和 `component_loader.py` 的上下文传递,以及新增的交叉注意力角色测试,理解 fail-closed 稀疏拒绝的取舍。

参与讨论