修复 DSpark 草案批次元数据缺失导致的启动与首请求崩溃
值得精读。重点看三处:一是 `_fill_dp_moe_sync_metadata` 中"缩放计数 vs 未缩放计数"的语义划分(CUDA graph 准入用原始请求数、EP accounting 用非填充 token 数),这是多机制交错下容易踩坑的契约;二是 `enable_num_token_non_padded` 环境开关的渐进式迁移模式;三是测试用 `__new__` 绕过构造器直接测方法契约的技巧。整体改动小而精准,是理解 SGLang 投机解码与 DP/EP 组合细节的好案例。
参与讨论