修复 merge_turn_segments 丢弃超长 segment 的 bug
该 PR 是一次轻量的 bugfix,逻辑清晰,改动集中。建议快速合并,无需深入精读。
slime is an LLM post-training framework for RL Scaling.
修复 merge_turn_segments 丢弃超长 segment 的 bug
该 PR 是一次轻量的 bugfix,逻辑清晰,改动集中。建议快速合并,无需深入精读。
抽取 Adapter 基类,封装会话生命周期管理
该 PR 值得核心开发者精读,尤其是 BaseAdapter 的设计模式和类型安全 AppKey 的使用。外部用户若已使用 agent 适配器应尽快迁移。
修复非MLA模型FLOPs计算错误的bug
值得立即合并。这是明确的计量 bugfix,改动小、逻辑清晰,且经过本地验证。建议后续补充单元测试,覆盖 MLA/非 MLA 两种场景的 FLOPs 计算。
新增 OpenAI 和 Anthropic 适配器并重构 agent 模块
建议所有参与 agent RL 训练的成员阅读此 PR,尤其是 `common.py` 中的 `AdapterChain` 和 `call_sglang_generate` 设计,它为后续添加新的 adapter 提供了清晰的模式。`openai.py` 中的 `_translate_chat_messages` 和 `_responses_input_to_messages` 体现了多协议消息格式转换的典型做法,值得参考。
修复 Qwen3 30B 与 Deepep 在 sglang 0.5.12 下的运行问题
值得合并。该 PR 解决了特定模型与运行时的兼容性问题,修复逻辑清晰,风险可控。建议在合并后增加相关 CI 测试覆盖,确保后续版本不会再次出现类似问题。
修复 GLM4.7 在 sglang v0.5.12 下的运行问题
建议项目组其他成员了解变更,尤其是需要维护 GLM4 系列模型的同学。可通过此 PR 学习 patch 中的条件模型初始化技巧。
细化 re-tokenization 问题文档说明
该 PR 值得精读,特别是对于使用 coding_agent_rl 进行多轮训练的用户。文档清晰解释了 token 级训练的核心设计原则和正确性保证机制。
修复 sglang 补丁中 mooncake offload 和索引问题
建议合并,修复了重要的问题,且改动经过测试。
参与讨论