为 DeepSeek V4 添加 MTP 接受长度检查
值得精读的文件是 `sglang/test/kits/spec_decoding_kit.py`(如果其定义可见),以理解 Mixin 的实现方式。本 PR 的批量混入模式可作为后续为其他模型添加性能断言的样板。建议维护一份阈值基线文档,定期验证阈值的有效性。
SGLang is a high-performance serving framework for large language models and multimodal models.
为 DeepSeek V4 添加 MTP 接受长度检查
值得精读的文件是 `sglang/test/kits/spec_decoding_kit.py`(如果其定义可见),以理解 Mixin 的实现方式。本 PR 的批量混入模式可作为后续为其他模型添加性能断言的样板。建议维护一份阈值基线文档,定期验证阈值的有效性。
原始 PR · 作者 Ibrahim2595 · 合并时间 2026-06-13 09:40
新增 llm-d 集成文档页面
该 PR 为常规文档更新,内容清晰、变更简单,无需深度精读。但可作为了解 SGLang 生态系统集成的参考。
修复 Nemotron DP attention + EP 模式下多冗余 AllReduce
该 PR 值得精读,尤其是对实现 DP attention 和 EP 混合并行的工程师。核心设计决策是:在 MoE 场景下,expert 计算后已通过 EP 隐式通信,后续只需一次 ReduceScatter 即可完成聚合,不应再额外做 AllReduce。通过 `skip_all_reduce` 和 `should_skip_post_experts_all_reduce` 的组合,优雅地解决了这一冗余通信问题。
清理 CUDA 图重构遗留的代码风格与配置项
建议快速合并。该 PR 是高质量的技术债务清理,尤其值得关注的是:1) 如何在不改变行为的前提下通过注释传达设计意图(如 `can_run` 中的禁用条件说明);2) 对于从未发布的 CLI 别名,选择直接删除而非走废弃周期,简化了长期维护。
添加cookbook迁移技能,规范遗留模板迁移
建议文档维护者快速接管本 PR,同时注意: - 仔细审阅 SKILL.md 中所有硬规则和 dimension-mapping.md 中的映射表,确保覆盖所有遗留模式。 - 关注策略命名规则和精度标志处理的设计权衡,这些是 cookbook 数据模型的关键决策。 - 后续迁移工作应严格遵循本技能定义的工作流。
将 prepare_for_draft 移到 EagleDraftWorkerBase
此 PR 值得所有关注 speculative decoding 开发的工程师阅读。它清晰展示了如何通过移动方法实现职责分离这一常见重构模式。重点关注 `base_spec_worker.py` 中新增的 `prepare_for_draft` 方法和 `duplicate_prefix_tail_to_draft_branches` 函数。建议后续合并 gemini-code-assist 提议的类型注解改进,以进一步提升代码质量。
为CUDA测试强制现代stage/runner_config注册形式,支持/rerun-test调度
值得精读,尤其是 `scripts/ci/check_registered_tests.py` 中的 AST 解析和正则校验设计,可作为同类预提交检查的参考。
修复 token_ids_logprob 越界导致引擎崩溃
值得精读,尤其是想了解如何在请求处理早期注入输入验证以预防 GPU 崩溃的工程师。新增的 `_validate_token_ids_logprob` 方法和对应的测试用例可作为类似的输入校验参考。
参与讨论