执行摘要
大规模重写高级文档,完善低精度训练、PD 分离、容灾等说明
PR 描述为空,但从变更内容推断,目的是解决原文档在高级主题(低精度训练、PD 分离、容灾)上结构不清晰、配置示例不足的问题,为大规模 MoE RL 用户提供更明确的指导路径。
推荐所有 slime 用户阅读更新后的文档,尤其是低精度训练和 PD 分离部分。对于新用户,建议从快速入门参考文档。维护者应确保后续代码变更同步更新文档。
该 PR 没有 comments 或 review 讨论,属于干净的单人提交。
PR 描述为空,但从变更内容推断,目的是解决原文档在高级主题(低精度训练、PD 分离、容灾)上结构不清晰、配置示例不足的问题,为大规模 MoE RL 用户提供更明确的指导路径。
推荐所有 slime 用户阅读更新后的文档,尤其是低精度训练和 PD 分离部分。对于新用户,建议从快速入门参考文档。维护者应确保后续代码变更同步更新文档。
该 PR 没有 comments 或 review 讨论,属于干净的单人提交。
docs/en/advanced/low-precision.md):新增特性成熟度表格,明确 BF16 训练 + FP8 rollout 为稳定生产路径;补充 FP8 KV cache、INT4 QAT 说明;整理命令示例和配置指引。docs/en/advanced/pd-disaggregation.md):新增何时使用 PD 的详细指导;区分简单路径 (--prefill-num-servers) 和高级路径 (--sglang-config);提供 SGLang Config YAML 示例。docs/en/advanced/fault-tolerance.md):重新定义 fault tolerance 范围;补充 health check 参数表;新增 debug/replay 路径 (--debug-rollout-only 等);提供推荐生产模式。docs/zh/ 目录,保持中英一致。index.rst 以反映新文档结构;在 quick_start.md 中添加高级功能链接。| 文件 | 模块 | 状态 | 重要度 |
|---|---|---|---|
docs/en/advanced/low-precision.md |
英文文档 | modified | 4.0 |
docs/zh/advanced/low-precision.md |
中文文档 | modified | 3.46 |
docs/en/advanced/pd-disaggregation.md |
英文文档 | modified | 3.46 |
docs/zh/advanced/pd-disaggregation.md |
中文文档 | modified | 3.38 |
docs/en/advanced/fault-tolerance.md |
英文文档 | modified | 3.43 |
docs/zh/advanced/fault-tolerance.md |
中文文档 | modified | 3.18 |
docs/en/advanced/low-precision.md
documentation
英文核心高级文档,最大变动(+75/-65),新增成熟度表格和生产路径推荐
# Convert BF16 model to FP8 with blockwise quantization
python tools/convert_hf_to_fp8.py \
--model-dir $BF16_MODEL \
--save-dir $FP8_MODEL \
--strategy block --block-size 128 128 \
--max-workers 4
# 确保转换后的 checkpoint 中 `config.json` 包含正确的 `quantization_config`
# slime 会在权重更新时使用该配置,训练侧保持 BF16,rollout 侧收到 FP8 权重
# 示例用法:
# --hf-checkpoint /path/to/model-fp8-hf
当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。
文档变更本身风险较低,主要风险包括:
1) 配置示例与未来版本代码不同步导致误导;
2) 部分描述可能过于简化。建议在后续版本中持续维护文档。
对用户学习路径有积极提升,尤其对大规模 MoE RL 的新用户。对系统行为无影响。
当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。
参与讨论