星尘智能发布SmoothRL异步强化学习框架
新浪科技讯 9月4日上午消息,近期,星尘智能(Astribot)核心团队推出了SmoothRL,这是一种支持异步执行的在线强化学习框架。该框架旨在解决大模型在真实部署中普遍采用异步推理后,在线强化学习究竟应该从哪些动作中获取经验的问题。 SmoothRL 首次在真实的高动态投掷任务中测试了此类异步在线强化学习,这进一步证实了在线学习不仅适用于高精度修正,还能胜任连续加速、精准释放以及不可中断的动态操作。 过去几年,机器人基础模型主要致力于解决“能不能”的问题,即利用更多数据和更强模型来拓宽能力范围。然而,