修复 dataclasses.replace 丢失显式字段属性
该 PR 值得阅读,因为它揭示了 Python `dataclasses.replace` 的一个常见陷阱:动态属性不会被复制。代码简洁、修复专注、测试覆盖好,是高质量的小型修复范例。
SGLang is a high-performance serving framework for large language models and multimodal models.
修复 dataclasses.replace 丢失显式字段属性
该 PR 值得阅读,因为它揭示了 Python `dataclasses.replace` 的一个常见陷阱:动态属性不会被复制。代码简洁、修复专注、测试覆盖好,是高质量的小型修复范例。
跳过边界 rank 的 WanVAE halo 发送副本
值得精读的实现级优化,展示了如何通过内存格式感知来避免分布式推理中的显式/隐式数据副本。`_halo_memory_format` 的检测模式可推广到其他分布式卷积/注意力模块。
支持 SWA 和 DeepSeek V4 的 L3 存储
值得精读。该 PR 是 HiCache 多级存储体系的重要拼图,展示了如何将两种特殊注意力组件(SWA 和 DeepSeek V4)集成到统一的 L3 存储架构中。`swa_component.py` 中的锁分离设计和 `mooncake_store.py` 的通用池注册重构具有参考价值。建议关注设计讨论中关于 `is_rank_replicated` 的重命名决策以及 `_page_transfer` 的顺序依赖问题。
原始 PR · 作者 alphabetc1 · 合并时间 2026-06-04 10:07
修复自适应推测测试的随机性失败
该 PR 适合合入以解决 flaky test 问题,但建议跟踪该测试后续是否仍能有效检测 gauge 更新机制回归。如果出现相关 bug,可考虑实现 Codex 建议的重试/轮询方案,在容忍延迟的同时保留严格验证。
原始 PR · 作者 zyzshishui · 合并时间 2026-06-04 09:45
新增 TITO 风格 chat:支持 pre-tokenized input_ids 和返回 prompt_token_ids
建议精读 `serving_chat.py` 中 `_convert_to_internal_request` 和 `_build_chat_response` 的实现,了解请求转换管线中字段优先级和错误处理的权衡。`protocol.py` 的自定义序列化方式也值得参考。对于部署运维,需注意 `skip_tokenizer_init` 场景的兼容性。
提取模拟接受长度采样函数以复用
值得合入,提高代码复用性。建议关注 `_sample_simulated_acc_len` 的用户,并考虑添加单元测试覆盖。
新增 num_waiting_uncached_tokens 负载指标
值得阅读以了解如何在不重复遍历缓存的情况下利用现有关联信息推导派生指标。其中 `supports_fast_match_prefix` 接口设计为不同缓存后端提供了优雅的扩展点,可作为类似场景的参考模式。
原始 PR · 作者 whybeyoung · 合并时间 2026-06-04 09:24
修复多 tokenizer 模式 ZMQ 绑定冲突
此 PR 值得精读,尤其是多进程通信中唯一所有者模式的实现、事件驱动的 fd 注册方式以及如何处理异步/同步上下文冲突。对于需要在多 tokenizer 环境下使用负载均衡的团队至关重要。
参与讨论