执行摘要
修复 docs 构建失败问题
由于已停止在每个 PR 上构建文档,需要在主分支上定期修复文档构建问题。
建议快速合并,属于基础设施修复,无需深入审查。
无 review 评论。
由于已停止在每个 PR 上构建文档,需要在主分支上定期修复文档构建问题。
建议快速合并,属于基础设施修复,无需深入审查。
无 review 评论。
vllm/model_executor/layers/fused_moe/experts/cpu_moe.py 中将返回类型描述中的多行元组格式合并为一行,以符合文档构建解析要求。vllm/model_executor/layers/fusion/__init__.py 文件(空内容),修复模块导入时的文档生成问题。| 文件 | 模块 | 状态 | 重要度 |
|---|---|---|---|
vllm/model_executor/layers/fused_moe/experts/cpu_moe.py |
模型执行器 | modified | 4.23 |
vllm/model_executor/layers/fusion/__init__.py |
模型执行器 | added | 4.11 |
vllm/model_executor/layers/fused_moe/experts/cpu_moe.py
data-contract
修复了 `prepare_int4_moe_layer_for_cpu` 函数的 docstring 格式,将返回元组从多行改为单行,消除了文档构建的解析错误。
Returns:
(blocked_w13, blocked_w2, blocked_s13, blocked_s2, blocked_z13, blocked_z2)
"""
E = w13_packed.size(0)
# No qzeros are available in compressed-tensors symmetric checkpoints.
# The GPTQ unpack kernel (unpack_4bit_to_32bit_signed) adds +1 to stored zeros,
# so we store 7 per nibble: 0x77777777 -> +1 -> 8.
if w13_zeros is None:
num_groups_w13 = w13_scale.size(1)
N_w13 = w13_scale.size(2) # 2*I
_zp = 0x77777777
w13_zeros = torch.full(
(E, num_groups_w13, N_w13 // 8),
_zp,
dtype=torch.int32,
)
if w2_zeros is None:
num_groups_w2 = w2_scale.size(1)
N_w2 = w2_scale.size(2) # K
_zp = 0x77777777
w2_zeros = torch.full(
(E, num_groups_w2, N_w2 // 8),
_zp,
dtype=torch.int32,
)
blocked_w13, blocked_z13, blocked_s13 = convert_weight_packed_scale_zp(
w13_packed, w13_zeros, w13_scale, quant_algo
)
blocked_w2, blocked_z2, blocked_s2 = convert_weight_packed_scale_zp(
w2_packed, w2_zeros, w2_scale, quant_algo
)
当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。
风险极低:变更仅为 docstring 格式调整和新增空文件,不影响运行逻辑。
直接影响:修复了主分支的文档构建管道,使开发者文档保持可用。间接影响:防止新 PR 因文档构建失败而被阻塞。
当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。
参与讨论