#35397 Support custom draft worker classes in DSpark
原始 PR · 作者 merrymercy · 合并时间 2026-08-20 08:48
DSpark 支持自定义 draft worker 类,默认行为不变。
值得快速浏览,作为了解 DSpark 扩展机制的参考。关注点:`draft_worker_cls` 的类型提示和默认值设计,以及未来若新增测试时需覆盖默认路径回归。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 merrymercy · 合并时间 2026-08-20 08:48
DSpark 支持自定义 draft worker 类,默认行为不变。
值得快速浏览,作为了解 DSpark 扩展机制的参考。关注点:`draft_worker_cls` 的类型提示和默认值设计,以及未来若新增测试时需覆盖默认路径回归。
原始 PR · 作者 merrymercy · 合并时间 2026-08-20 08:48
修复 top-k renorm Triton 内核 int32 偏移溢出。
该 PR 为小而关键的 bugfix,值得精读以了解 Triton 偏移计算的陷阱。建议关注是否存在其他类似溢出点,并考虑补充回归测试。
扩展 MoE 预调度内核,支持超 8192 宽 hidden 维度。
值得精读,尤其是对 CUDA JIT 内核开发者:本 PR 展示了如何用模板特化同时满足“新形状可用”和“旧形状零回归”两种诉求,静态断言约束量化组对齐的思路也可以推广到其它分块内核。建议在合并前或合并后尽快补充覆盖多 chunk 边界的自动化单测,并对真实 DeepSeek MoE 模型做端到端 benchmark 验证。
原始 PR · 作者 elvischenv · 合并时间 2026-08-20 08:01
升级 tilelang 至 0.1.12 修复 FlashInfer 融合初始化
值得合并,但建议关注升级后 FlashInfer 融合的实测性能。可精读 tile-ai/tilelang#2541 了解根因。
修复 compressed-tensors 量化 lm_head 加载乱码问题
建议精读。该 PR 展示了一个典型的“配置语义与加载器约束冲突”问题:量化方案的 target 匹配规则由上游 `llm-compressor` 决定,而权重加载器对分片维度有硬性限制。`get_lm_head_scheme` 中对“按层名匹配 vs 模块类型匹配”的区分、以及 `matched_target` 透传的设计,在后续支持更多量化格式时值得复用。
拒绝 grammar 中的 NUL 字节,修复 xgrammar 段错误
此 PR 值得精读,尤其是 `_grammar_key_contains_nul` 的实现细节,展示了如何在底层第三方库存在潜在崩溃风险时,通过上层校验来规避。也展示了好的防御性编程实践。
修复 min-new-token 对模型配置 EOS 的处理与崩溃
该 PR 值得精读,尤其关注 `_prepare()` 中如何合并 EOS 集合和过滤 None 值。这是一个小而精准的 bugfix,展示了如何处理 tokenizer 与模型配置不一致的情况。
原始 PR · 作者 xiezhq-hermann · 合并时间 2026-08-20 06:23
优化 HiCache buffer_mode 类型检查,改用 isinstance。
该 PR 属于小规模代码风格优化,不需要精读核心逻辑,但值得快速浏览,了解对 HiCache `buffer_only` 模式的类型检查处理的改进。可参考其使用 `isinstance` 替代字符串比较,类似的模式值得在代码库中推广。
参与讨论