Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-05 05:40 同步状态:空闲 下次计划:2026-09-05 06:40

PR 列表

更多筛选
2026-06-04
重构 重要性 7.00 洞察度 6.00

跳过边界 rank 的 WanVAE halo 发送副本

值得精读的实现级优化,展示了如何通过内存格式感知来避免分布式推理中的显式/隐式数据副本。`_halo_memory_format` 的检测模式可推广到其他分布式卷积/注意力模块。

功能 重要性 8.78 洞察度 6.00

支持 SWA 和 DeepSeek V4 的 L3 存储

值得精读。该 PR 是 HiCache 多级存储体系的重要拼图,展示了如何将两种特殊注意力组件(SWA 和 DeepSeek V4)集成到统一的 L3 存储架构中。`swa_component.py` 中的锁分离设计和 `mooncake_store.py` 的通用池注册重构具有参考价值。建议关注设计讨论中关于 `is_rank_replicated` 的重命名决策以及 `_page_transfer` 的顺序依赖问题。

#27135 [codex] Fix adaptive metrics test flake

原始 PR · 作者 alphabetc1 · 合并时间 2026-06-04 10:07

缺陷修复 重要性 3.68 洞察度 3.00

修复自适应推测测试的随机性失败

该 PR 适合合入以解决 flaky test 问题,但建议跟踪该测试后续是否仍能有效检测 gauge 更新机制回归。如果出现相关 bug,可考虑实现 Codex 建议的重试/轮询方案,在容忍延迟的同时保留严格验证。

#23751 [3/N][Sync sglang-miles] TITO Support

原始 PR · 作者 zyzshishui · 合并时间 2026-06-04 09:45

功能 重要性 7.63 洞察度 6.00

新增 TITO 风格 chat:支持 pre-tokenized input_ids 和返回 prompt_token_ids

建议精读 `serving_chat.py` 中 `_convert_to_internal_request` 和 `_build_chat_response` 的实现,了解请求转换管线中字段优先级和错误处理的权衡。`protocol.py` 的自定义序列化方式也值得参考。对于部署运维,需注意 `skip_tokenizer_init` 场景的兼容性。

重构 重要性 6.77 洞察度 4.00

提取模拟接受长度采样函数以复用

值得合入,提高代码复用性。建议关注 `_sample_simulated_acc_len` 的用户,并考虑添加单元测试覆盖。

#27174 Add num_waiting_uncached_tokens load metric

原始 PR · 作者 cctry · 合并时间 2026-06-04 09:29

功能 重要性 7.00 洞察度 5.00

新增 num_waiting_uncached_tokens 负载指标

值得阅读以了解如何在不重复遍历缓存的情况下利用现有关联信息推导派生指标。其中 `supports_fast_match_prefix` 接口设计为不同缓存后端提供了优雅的扩展点,可作为类似场景的参考模式。

缺陷修复 重要性 8.03 洞察度 5.00

修复多 tokenizer 模式 ZMQ 绑定冲突

此 PR 值得精读,尤其是多进程通信中唯一所有者模式的实现、事件驱动的 fd 注册方式以及如何处理异步/同步上下文冲突。对于需要在多 tokenizer 环境下使用负载均衡的团队至关重要。

参与讨论