返回工具列表
SkyRL
面向 LLM 代理训练的全栈强化学习库,支持多轮工具交互和异步 rollout,可单 GPU 高效训练。
工具简介
SkyRL 由 UC Berkeley Sky 实验室开发,基于 VeRL 和 OpenHands 构建,提供从环境模拟、rollout 生成到策略优化的完整 RL 训练流程。它的核心优势在于将 rollout 作为异步服务执行,解耦 I/O 密集与 GPU 密集环节,训练速度提升 1.55 倍,并在 SWE-Bench Verified 上将 Qwen3-32B 的 Pass@1 从 24.4% 提升至 39.4%,成本降低一半以上。项目实现了后端无关设计,可切换 SkyRL-train、VeRL 或 Tinker 训练器,并支持协同训练与推理,使单 GPU 环境也能进行 RL 训练。然而,SkyRL 目前仍是快速迭代的研究库,部分实验性能提升有限(例如 7B 模型仅提升 3.6%),且要求使用者具备一定强化学习和代码代理知识。项目开源、免费,但需要 GPU 计算资源。适合研究多轮工具调用 RL 训练、希望低成本复现或改进代理能力的学生与团队;不适合期望零门槛上手或生产级稳定性的开发者。