Research · Applications · Models
星尘智能发布SmoothRL框架,解决机器人异步执行下的在线强化学习问题
星尘智能发布SmoothRL框架,解决机器人异步执行下的在线强化学习问题,动态投掷任务成功率从39%提升至94%,给笔戴帽任务从8%提升至83%。
阅读 量子位 原文为什么重要
该框架显著提升了机器人在真实世界异步控制中的学习效率和成功率,对机器人操作技能的快速习得具有重要推动作用。
关键事实
事实 1
在累计250个rollout episodes的评估节点,动态投掷任务成功率从基础策略的39%提升至94%。
来源与依据
在累计 250 个 rollout episodes 的评估节点,成功率从基础策略的 39% 提升至 94%。
事实 2
给笔戴帽任务的最终成功率从8%提升至83%。
来源与依据
给笔戴帽:8% → 83%。
事实 3
在SmoothRL的实现中,基础策略每次预测32帧动作,其中6帧属于本轮真正执行的Execution Region。
来源与依据
基础策略每次预测 32 帧动作;在固定延迟预算下,Committed 与 Execution 共占 12 帧,其中 6 帧属于本轮真正执行的 Execution Region