Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-04 00:39 同步状态:空闲 下次计划:2026-09-04 01:39

PR 列表

更多筛选
2026-07-24

#32256 init sglang rust server project

原始 PR · 作者 rainj-me · 合并时间 2026-07-24 05:47

基础设施 重要性 5.86 洞察度 4.00

初始化 Rust Server 项目框架

该 PR 是 Rust 化演进的第一步架构决策,值得关注。设计上选择双 crate-type(cdylib + rlib)以支持从 Python 导入和 Rust 原生测试;通过 workspace 统一依赖版本管理;模块注释清晰描述了未来流水线的 GIL 控制思路。建议在后续功能 PR 中及时移除 `#[allow(dead_code)]` 并添加单元测试。

#29569 [DSV4] Support megamoe for CP

原始 PR · 作者 SYChen123 · 合并时间 2026-07-24 05:46

功能 重要性 7.70 洞察度 7.00

支持 DeepSeek V4 CP 与 MegaMoE 协同使用

- 值得精读,尤其是 `validate_deepseek_v4_mega_moe_token_budget` 函数的设计——它考虑了多种并行组合下 per-rank token 数的计算,为类似跨组件的参数校验提供了良好范本。 - 关注 `should_use_mega_moe` 中 CP 分支的修改,理解为什么 CP 下需要用 local token 数而非 global token 数来决策。 - 若用户环境默认 `moe_a2a_backend` 可能为 `None`,建议在文档中明确指出需显式设置。

#32246 Fix nvfp4 online scale with pcg

原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-07-24 05:42

缺陷修复 重要性 4.84 洞察度 2.00

修复 NVFP4 在线量化时 scale 为 Python 标量的问题

可以快速合并。但建议作者或团队后续补充针对 per_token_activation 路径的单元测试,避免回归。

功能 重要性 7.57 洞察度 6.00

OpenAI 端点新增 return_token_ids,返回原始 token ids

值得精读。核心看点有三个:一是流式场景下累积/增量两种模式下 token ids 与文本 delta 的对齐处理(n_prev_token_ids 切片 vs 直接透传),二是顺带修复的增量流式文本二次切片 bug——这是新测试暴露存量缺陷的典型案例,三是协议层用 model_serializer 在 None 时剔除字段以保持默认响应不变的扩展方式。若你有 chat 流式 token ids 需求,可关注作者提出的"原始 token 流独立于解析文本流返回"的后续方案。

性能优化 重要性 9.14 洞察度 7.00

CP decode消除重复注意力权重GEMM冗余

建议精读。该 PR 展示了在 CP 模式下消除权重冗余的优雅设计(上下文管理器 + 延迟切片缓存),review 中也暴露了 all-reduce 组、量化尺度等关键陷阱。值得学习如何在推理引擎中安全地临时替换张量视图。

缺陷修复 重要性 4.00 洞察度 4.00

修复MLX模型因量化配置缺失导致启动失败

作为典型的防御式编程修复,值得所有涉及字典键访问的代码参考。建议合入后关注是否有其他覆盖方法存在类似问题。

参与讨论