Prhub

radixark/miles · 标签视图

标签列表

聚合结果

fp8-quantization 相关 PR

2026-08-30
性能优化 重要性 6.57 洞察度 7.00

清空 TE 量化缓存,offload 省 45% 主机内存流量

本 PR 值得精读。diff 极小(+32/-1),但有两层学习价值:一是 PR body 展示了如何用“每元素字节数 × 模块数”做理论测算并与实测对照(91%/96% 兑现率),并清晰量化了 MXFP8 与 NVFP4 两种布局的成本差异;二是评审者的收敛过程说明——默认开启的开关配 assert 会误伤无关配置(bf16 + CUDA graphs),以及跨后端共享工具中 Megatron 特定逻辑的放置取舍。可作为 offload 前释放派生缓冲的性能优化参考模板。

2026-08-24
功能 重要性 8.31 洞察度 5.00

新增 DSV4-0731 支持与 MXFP4→FP8 转换器

值得精读,重点看 cast_e2m1fn_to_e4m3fn 的无损转换实现、e8m0fnu→float32 兼容处理,以及 rematerialize 对冻结参数的备份修复。若团队后续要接入其他 MXFP4 官方发布,可直接复用该转换器模式。

2026-08-20
2026-08-13

#2478 docs: rewrite INT4 QAT guide

原始 PR · 作者 nanjiangwill · 合并时间 2026-08-13 04:13

文档 重要性 4.43 洞察度 4.00

重写 INT4 QAT 指南,修正 W4A16 训练路径描述

值得精读。该 PR 虽然只改一个文档文件,但准确区分了“训练时 fake 量化”与“rollout 时 packed 存储格式”两组易混淆概念,并明确了 Megatron Bridge 的双向打包职责与 `OPEN_TRAINING_INT4_GROUP_SIZE` 的独立语义。对理解 miles 的 INT4 QAT 架构、Kimi-K2.5 初始化路径以及 Qwen 路径的 group size 现实差异,都是最直接的一手资料;也适合作为文档审计类 PR 的范本。

2026-08-12

#2396 docs: refresh MXFP8 and NVFP4 RL guide

原始 PR · 作者 zianglih · 合并时间 2026-08-12 07:54

文档 重要性 5.03 洞察度 4.00

刷新 MXFP8/NVFP4 低精度 RL 指南并重命名页面

值得精读,尤其适合负责 Blackwell 低精度训练的用户、文档维护者与关注 RoI 的技术管理者。核心看点:① 四阶段精度契约与 rollout × 训练兼容矩阵如何把 MoE RL 精度漂移的排障成本前置;② MXFP8 的 MoE / dense GEMM 后端选择拆分,纠正了旧文档单点建议的误导;③ NVFP4 后向模式「基础 + 高级选项」的分级呈现与外部来源引用策略;④ 文档重命名时全站链接、重定向与跨 PR 冲突处理的最佳实践。建议结合 issue #615 及其实现 PR 对照阅读。

2026-08-05
缺陷修复 重要性 5.79 洞察度 4.00

按后端 scale 格式门控 ue8m0 权重量化

该 PR 值得快速精读,尤其是 3 个 commit 反映的方案演进:从 `DEEPGEMM_SCALE_UE8M0` 门控改为真实 TE 环境变量门控,体现了“用训练侧事实约束转换侧行为”的设计思路。值得关注的设计决策:把后端能力判断(DeepGEMM 是否支持 ue8m0)与训练侧 scale 格式选择解耦。建议后续补充:环境变量缺失兜底、AMD gfx942/gfx950 分支、以及针对转换输出的回归测试。

2026-08-04

#2043 Compact NVFP4 BF16 MoE exclusion metadata

原始 PR · 作者 zianglih · 合并时间 2026-08-04 05:48

重构 重要性 5.71 洞察度 5.00

NVFP4 转换器压缩 BF16 MoE 排除项,冗余从 3571 降至 499

值得快速精读 `tools/convert_hf_to_nvfp4.py` 的 else 分支,理解“动态 BF16 层专家折叠为容器、同时保留层前缀与容器前缀”的取舍。对维护量化转换管线的同学有参考价值;注意测试当前被 CI 禁用,合并后建议留意后续启用时机。

2026-07-31

#2014 fix: quantize non-interleaved DSA indexer wk

原始 PR · 作者 xiuhu17 · 合并时间 2026-07-31 11:03

缺陷修复 重要性 6.25 洞察度 5.00

按 indexer_rope_interleave 条件量化 DSA indexer wk

值得精读:它展示了对历史修复的回溯修正,以及基于下游引擎(SGLang)参数布局做条件化量化的设计模式。建议结合 #1928 一起阅读,理解 DSA indexer 在 interleaved/非 interleaved 下的差异;同时关注 `indexer_rope_interleave` 配置在模型转换链路中的传递可靠性。