Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-05 03:32 同步状态:空闲 下次计划:2026-09-05 04:32

PR 列表

更多筛选
2026-06-25

#26245 Support DP-aware PD router dispatch

原始 PR · 作者 weireweire · 合并时间 2026-06-25 06:02

缺陷修复 重要性 9.12 洞察度 7.00

修复 DP-aware PD 路由的调度和 URL 问题

建议工程师精读该 PR,尤其是 `prepare_worker_request` 和 `inject_prefill_dp_rank_for_decode` 的设计,它展示了如何在不破坏现有非 DP 模式的前提下,优雅扩展 DP 感知逻辑。同时,`parse_bootstrap_host_from_url` 的防御式编程(fallback 为 localhost)值得学习。

#29198 Convert SamplingParams to msgspec Struct

原始 PR · 作者 merrymercy · 合并时间 2026-06-25 04:42

重构 重要性 7.74 洞察度 6.00

将 SamplingParams 转换为 msgspec Struct 以支持 msgpack 序列化

值得精读。重点关注:1) msgspec.Struct 的继承设计和 __post_init__ 的使用方式;2) is_normalized 标志如何回避 msgpack 反序列化中的重复处理;3) 通过 omit_defaults 和清除别名实现紧凑序列化的技巧。建议在合并后密切关注运行中的行为是否符合预期,特别是 top_k 默认值的变化。

性能优化 重要性 9.36 洞察度 7.00

为GLM5引入BCG支持并优化prefill性能

强烈建议精读。本 PR 展示了如何在推理框架中平衡 eager 与 CUDA 图执行,是 CUDA 图后端演进的关键步骤。特别关注 `MlaBmmFusionPlan` 和 `mla_bmm_then_unified_attention` 的设计,以及在 split op 中灵活切换 eager 与图的策略。讨论中的设计取舍值得团队参考。

#28749 Fix nightly CI test for GLM-4.6 + B200

原始 PR · 作者 b8zhong · 合并时间 2026-06-25 03:34

缺陷修复 重要性 4.88 洞察度 3.00

修复 GLM-4.6 在 B200 上的 CI 失败

建议快速合入。这是一个针对硬件特定配置的精准修复,改动量小且经过验证。

性能优化 重要性 4.94 洞察度 4.00

优化 draft extend 的 select_index 计算

该 PR 极小且安全,建议直接合并。虽无测试覆盖,但由于逻辑等价且改动简单,风险可控。对于追求极致性能的工程师,可关注此类微优化;对于一般开发者,可快速略过。

#28952 Add DeepSeek V4 Flash demo notebook

原始 PR · 作者 anushapant · 合并时间 2026-06-25 02:42

文档 重要性 4.62 洞察度 3.00

添加 DeepSeek-V4-Flash 演示 notebook

该 PR 适合作为入门参考,尤其是需要快速体验 DeepSeek-V4-Flash 长上下文能力的用户。但技术人员若关注推理引擎深度优化,可跳过此 PR。

#29098 Extract profile request cleanups

原始 PR · 作者 merrymercy · 合并时间 2026-06-25 02:22

重构 重要性 8.09 洞察度 5.00

统一 ProfileReqInput 为 ProfileReq 并清理接口

推荐阅读 `io_struct.py` 和 `common.py` 中的重构模式。核心设计决策包括:① 将 `ProfileReqType` 枚举作为 `ProfileReq` 的成员,避免外部重复定义;② 通过 `normalize_serialized_named_tensor_payloads` 统一多来源tensor数据的格式,可以作为一种数据清洗模式在其他场景复用。

参与讨论