#32254 [spec decoding] fix inkling multi layer mtp draft extend cuda graph
原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-07-24 05:52
修复 Inkling MTP draft extend 的 CUDA Graph 宽度不匹配
建议快速合并。对于涉及 CUDA Graph 的类似场景,应建立一致性检查(如在输入构建时断言维度匹配)。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-07-24 05:52
修复 Inkling MTP draft extend 的 CUDA Graph 宽度不匹配
建议快速合并。对于涉及 CUDA Graph 的类似场景,应建立一致性检查(如在输入构建时断言维度匹配)。
回退 Docker 开发镜像中 Dynamo nightly 安装
此 PR 为纯回退操作,逻辑简单,无需深入精读。建议关注未来重新引入该功能时需要解决的 CI 失败根因。
初始化 Rust Server 项目框架
该 PR 是 Rust 化演进的第一步架构决策,值得关注。设计上选择双 crate-type(cdylib + rlib)以支持从 Python 导入和 Rust 原生测试;通过 workspace 统一依赖版本管理;模块注释清晰描述了未来流水线的 GIL 控制思路。建议在后续功能 PR 中及时移除 `#[allow(dead_code)]` 并添加单元测试。
支持 DeepSeek V4 CP 与 MegaMoE 协同使用
- 值得精读,尤其是 `validate_deepseek_v4_mega_moe_token_budget` 函数的设计——它考虑了多种并行组合下 per-rank token 数的计算,为类似跨组件的参数校验提供了良好范本。 - 关注 `should_use_mega_moe` 中 CP 分支的修改,理解为什么 CP 下需要用 local token 数而非 global token 数来决策。 - 若用户环境默认 `moe_a2a_backend` 可能为 `None`,建议在文档中明确指出需显式设置。
原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-07-24 05:42
修复 NVFP4 在线量化时 scale 为 Python 标量的问题
可以快速合并。但建议作者或团队后续补充针对 per_token_activation 路径的单元测试,避免回归。
OpenAI 端点新增 return_token_ids,返回原始 token ids
值得精读。核心看点有三个:一是流式场景下累积/增量两种模式下 token ids 与文本 delta 的对齐处理(n_prev_token_ids 切片 vs 直接透传),二是顺带修复的增量流式文本二次切片 bug——这是新测试暴露存量缺陷的典型案例,三是协议层用 model_serializer 在 None 时剔除字段以保持默认响应不变的扩展方式。若你有 chat 流式 token ids 需求,可关注作者提出的"原始 token 流独立于解析文本流返回"的后续方案。
CP decode消除重复注意力权重GEMM冗余
建议精读。该 PR 展示了在 CP 模式下消除权重冗余的优雅设计(上下文管理器 + 延迟切片缓存),review 中也暴露了 all-reduce 组、量化尺度等关键陷阱。值得学习如何在推理引擎中安全地临时替换张量视图。
原始 PR · 作者 calvin0327 · 合并时间 2026-07-24 05:01
修复MLX模型因量化配置缺失导致启动失败
作为典型的防御式编程修复,值得所有涉及字典键访问的代码参考。建议合入后关注是否有其他覆盖方法存在类似问题。
参与讨论