修复 filter_long_prompt 混合多模态数据顺序错乱
值得精读:修复点集中、测试设计精巧(用替身与桩避免引入 transformers),是优化引入回归后最小代价恢复正确性的典型样例。数据管线与 VLM 训练相关同学建议细看 filter_long_prompt 的实现与测试写法。
slime is an LLM post-training framework for RL Scaling.
修复 filter_long_prompt 混合多模态数据顺序错乱
值得精读:修复点集中、测试设计精巧(用替身与桩避免引入 transformers),是优化引入回归后最小代价恢复正确性的典型样例。数据管线与 VLM 训练相关同学建议细看 filter_long_prompt 的实现与测试写法。
修复数据集路径负索引切片崩溃
该 PR 值得快速阅读,但除非团队经常使用负索引切片,否则不必精读。值得关注的设计决策是「按边界符号分流:非负走流式 `islice`、负边界物化走列表切片」,这是一个务实的兼容性取舍。建议阅读 `slime/utils/data.py` 的 `read_file` 修改和新增测试文件,理解其权衡过程;后续如有大规模数据集使用负切片的场景,可考虑更优方案(如先统计行数再转正索引)。
原始 PR · 作者 qq1243196045 · 合并时间 2026-08-12 13:29
修复 gpu_id 字符串排序导致 16 卡 GPU 顺序错乱
该 PR 是小而关键的 bugfix,值得精读,尤其是 placement_group.py 中的 sort_key 逻辑。建议合并后补充一个针对多卡排序的单元测试,以覆盖此场景,防止回归。
转发 eps_clip_c 修复双截断 PPO 未生效
值得快速阅读。改动虽小,但补上了配置与损失路径之间的断点;测试用 AST 检查参数透传的做法在缺少直接导出时可借鉴,但也提示此类『接线 bug』最好通过面向行为的集成测试覆盖。
修正 OPD 文档逆 KL 定义并补充采样细节
无需精读,但建议阅读公式部分以支持后续开发。值得关注两点:一是逆 KL 方向的定义符合 Thinking Machines Lab 的标准;二是明确采样误差的说明(单个 `d_t` 可能为负),有助于理解 OPD 的随机性。
修复 block_fp8 全零块产生 NaN 权重的问题
该 PR 值得精读,尤其是对于使用 `block_fp8` 进行模型量化的团队。它展示了一个典型边界条件的修复,并通过引入针对性的单元测试强化了代码契约。建议关注测试的编写方式(动态加载模块、CPU 运行)以及钳制值选择的一致性。
修复 partial rollout 续跑时重复使用完整响应预算
该 PR 值得精读,虽然改动小,但涉及正确性修复,且回归源于 1eed2493 重构。建议关注其根因与测试缺失,未来应补充单元测试覆盖 partial rollout 续跑预算计算。
修复 Qwen3 SFT 连续 tool 响应 tokenization 不一致
值得精读,特别是了解 loss-mask 生成器如何处理工具消息的上下文依赖。设计决策值得关注:最小化改动而非全量重构,通过分组连续 tool 消息修复 bug,并保留原有架构。
参与讨论