Prhub

THUDM/slime

slime is an LLM post-training framework for RL Scaling.

监控状态:已开启 最近同步:2026-09-01 17:42 同步状态:空闲 下次计划:2026-09-01 18:42

PR 列表

更多筛选
2026-05-29

#1982 [agent] Fix dropping overlong sample

原始 PR · 作者 zhuzilin · 合并时间 2026-05-29 21:03

缺陷修复 重要性 6.10 洞察度 4.00

修复 merge_turn_segments 丢弃超长 segment 的 bug

该 PR 是一次轻量的 bugfix,逻辑清晰,改动集中。建议快速合并,无需深入精读。

#1981 [agent] extract Adapter class

原始 PR · 作者 zhuzilin · 合并时间 2026-05-29 20:41

重构 重要性 8.96 洞察度 5.00

抽取 Adapter 基类,封装会话生命周期管理

该 PR 值得核心开发者精读,尤其是 BaseAdapter 的设计模式和类型安全 AppKey 的使用。外部用户若已使用 agent 适配器应尽快迁移。

缺陷修复 重要性 6.61 洞察度 5.00

修复非MLA模型FLOPs计算错误的bug

值得立即合并。这是明确的计量 bugfix,改动小、逻辑清晰,且经过本地验证。建议后续补充单元测试,覆盖 MLA/非 MLA 两种场景的 FLOPs 计算。

#1979 [agent] Add openai and anthropic adapters

原始 PR · 作者 zhuzilin · 合并时间 2026-05-29 19:30

功能 重要性 9.18 洞察度 6.00

新增 OpenAI 和 Anthropic 适配器并重构 agent 模块

建议所有参与 agent RL 训练的成员阅读此 PR,尤其是 `common.py` 中的 `AdapterChain` 和 `call_sglang_generate` 设计,它为后续添加新的 adapter 提供了清晰的模式。`openai.py` 中的 `_translate_chat_messages` 和 `_responses_input_to_messages` 体现了多协议消息格式转换的典型做法,值得参考。

缺陷修复 重要性 4.94 洞察度 4.00

修复 Qwen3 30B 与 Deepep 在 sglang 0.5.12 下的运行问题

值得合并。该 PR 解决了特定模型与运行时的兼容性问题,修复逻辑清晰,风险可控。建议在合并后增加相关 CI 测试覆盖,确保后续版本不会再次出现类似问题。

#1977 [docker] fix GLM4.7 flash for sglang v0.5.12

原始 PR · 作者 zhuzilin · 合并时间 2026-05-29 17:21

缺陷修复 重要性 5.30 洞察度 4.00

修复 GLM4.7 在 sglang v0.5.12 下的运行问题

建议项目组其他成员了解变更,尤其是需要维护 GLM4 系列模型的同学。可通过此 PR 学习 patch 中的条件模型初始化技巧。

文档 重要性 3.21 洞察度 4.00

细化 re-tokenization 问题文档说明

该 PR 值得精读,特别是对于使用 coding_agent_rl 进行多轮训练的用户。文档清晰解释了 token 级训练的核心设计原则和正确性保证机制。

#1973 [docker] fix patch

原始 PR · 作者 zhuzilin · 合并时间 2026-05-29 13:50

缺陷修复 重要性 5.21 洞察度 3.00

修复 sglang 补丁中 mooncake offload 和索引问题

建议合并,修复了重要的问题,且改动经过测试。

参与讨论