星尘智能发布SmoothRL异步强化学习框架
新浪科技讯 9月4日上午消息,近期,星尘智能(Astribot)核心团队推出了SmoothRL,这是一种支持异步执行的在线强化学习框架。该框架旨在解决大模型在真实部署中普遍采用异步推理后,在线强化学习究竟应该从哪些动作中获取经验的问题。
SmoothRL 首次在真实的高动态投掷任务中测试了此类异步在线强化学习,这进一步证实了在线学习不仅适用于高精度修正,还能胜任连续加速、精准释放以及不可中断的动态操作。
过去几年,机器人基础模型主要致力于解决“能不能”的问题,即利用更多数据和更强模型来拓宽能力范围。然而,当机器人真正置身于真实环境时,新的挑战往往不是完全不会,而是存在几毫米的误差、半拍的延迟,或者是物体位置变化导致的稳定性不足。
SmoothRL 关注的是更深层次的能力:即一个具备基础能力的预训练策略,在进入真实世界后,能否根据实际执行情况进行自我修正。SmoothRL 面向的是一个日益具体的问题:预训练让机器人掌握了基本操作,而真实世界中的后训练则能将这些能力打磨得更加精准、稳定和可靠。
随着模型能力的全面拓展,星尘的“AI模型-具身操作系统-绳驱本体”全栈系统也在不断迭代,从而加速 Physical AI 的应用落地与规模化部署。
未来,团队计划深入探索更大范围的策略更新、更多样化的任务分布,以及异步执行与生成式策略端到端优化相结合的方案。