Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-08-20
功能 重要性 4.77 洞察度 4.00

DSpark 支持自定义 draft worker 类,默认行为不变。

值得快速浏览,作为了解 DSpark 扩展机制的参考。关注点:`draft_worker_cls` 的类型提示和默认值设计,以及未来若新增测试时需覆盖默认路径回归。

功能 重要性 5.51 洞察度 5.00

扩展 MoE 预调度内核,支持超 8192 宽 hidden 维度。

值得精读,尤其是对 CUDA JIT 内核开发者:本 PR 展示了如何用模板特化同时满足“新形状可用”和“旧形状零回归”两种诉求,静态断言约束量化组对齐的思路也可以推广到其它分块内核。建议在合并前或合并后尽快补充覆盖多 chunk 边界的自动化单测,并对真实 DeepSeek MoE 模型做端到端 benchmark 验证。

#30874 chore: bump tilelang to 0.1.12

原始 PR · 作者 elvischenv · 合并时间 2026-08-20 08:01

dependencies 重要性 3.43 洞察度 3.00

升级 tilelang 至 0.1.12 修复 FlashInfer 融合初始化

值得合并,但建议关注升级后 FlashInfer 融合的实测性能。可精读 tile-ai/tilelang#2541 了解根因。

缺陷修复 重要性 7.73 洞察度 5.00

修复 compressed-tensors 量化 lm_head 加载乱码问题

建议精读。该 PR 展示了一个典型的“配置语义与加载器约束冲突”问题:量化方案的 target 匹配规则由上游 `llm-compressor` 决定,而权重加载器对分片维度有硬性限制。`get_lm_head_scheme` 中对“按层名匹配 vs 模块类型匹配”的区分、以及 `matched_target` 透传的设计,在后续支持更多量化格式时值得复用。

缺陷修复 重要性 7.18 洞察度 6.00

拒绝 grammar 中的 NUL 字节,修复 xgrammar 段错误

此 PR 值得精读,尤其是 `_grammar_key_contains_nul` 的实现细节,展示了如何在底层第三方库存在潜在崩溃风险时,通过上层校验来规避。也展示了好的防御性编程实践。

#31378 [Bugfix] Fix min-new-token EOS handling

原始 PR · 作者 milesial · 合并时间 2026-08-20 06:29

缺陷修复 重要性 5.55 洞察度 4.00

修复 min-new-token 对模型配置 EOS 的处理与崩溃

该 PR 值得精读,尤其关注 `_prepare()` 中如何合并 EOS 集合和过滤 None 值。这是一个小而精准的 bugfix,展示了如何处理 tokenizer 与模型配置不一致的情况。

重构 重要性 5.42 洞察度 3.00

优化 HiCache buffer_mode 类型检查,改用 isinstance。

该 PR 属于小规模代码风格优化,不需要精读核心逻辑,但值得快速浏览,了解对 HiCache `buffer_only` 模式的类型检查处理的改进。可参考其使用 `isinstance` 替代字符串比较,类似的模式值得在代码库中推广。

参与讨论