Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 21:09 同步状态:空闲 下次计划:2026-09-03 22:09

PR 列表

更多筛选
2026-04-29
功能 重要性 8.54 洞察度 6.00

FlashInfer TRTLLM-Gen 融合 MoE 支持非门控 FP4/FP8,加速 NemotronH-120B

值得精读。该 PR 清晰展示了如何为 FlashInfer TRTLLM-Gen MoE 后端扩展非门控激活支持,包括权重对齐策略、激活类型传递和自动 backend 选择。设计中的分支权衡和测试取舍也值得关注。建议重点关注 `_align_fp8_moe_weights` 函数的对齐逻辑和 `activation_type` 参数传递链。

重构 重要性 7.60 洞察度 5.00

拆分 accept_length 为 drafts 和 tokens 两个字段

值得精读,尤其是 `EagleDraftInput` 的字段设计、CUDA 图运行器的双缓冲策略、以及 `eagle_info_v2.py` 中 `sample()` 的变异解耦。这些设计决策可以在类似需要消除隐式语义的场景中复用。

功能 重要性 8.62 洞察度 6.00

在 HiCache 中同步 draft KV 缓存修复 accept length 退化

本 PR 修复了一个关键的 Spec+HiCache 协同 bug,设计合理(piggyback 式同步),且提供了完整的 benchmark 数据验证。此外,`_get_draft_kv_pool` 的抽取体现了良好的重构意识。建议阅读 `_maybe_register_hicache_draft` 和 `start_writing` 中的同步逻辑,理解如何在现有框架下优雅地加入辅助缓存池。

功能 重要性 7.88 洞察度 6.00

引入官方 GT 优先级并修复对齐

建议关注 GT 回退策略设计(优先级 + 存在性检查),可作为跨版本测试基础设施的参考。对于 Qwen-Image 相关开发者,需了解后处理扩展模式,便于其他模型复用。

#23857 Nemotron-omni-v3-alias

原始 PR · 作者 yhyang201 · 合并时间 2026-04-29 11:08

功能 重要性 6.43 洞察度 2.00

为 Nemotron Omni V3 模型添加别名支持

值得快速合并。这是一个标准的模型别名注册 PR,结构清晰,风险低。建议未来为 Nemotron Omni V3 添加独立的测试用例以验证加载和推理。

参与讨论