Physical Intelligence:我们开发了一种强化学习方法,只需几小时甚至几分钟就能微调模型…


我们开发了一种强化学习方法,只需几小时甚至几分钟就能微调模型完成特定任务。不用重训整个模型,我们在最新的π-0.6模型中加了个"RL token"输出,由小型的actor和critic通过强化学习快速学习。

我们开发了一种强化学习方法,只需几小时甚至几分钟就能微调模型完成特定任务。不用重训整个模型,我们在最新的π-0.6模型中加了个"RL token"输出,由小型的actor和critic通过强化学习快速学习。

—— Physical Intelligence (@physical_int) X帖子|2026-03-19T20:26:25+00:00
原帖:https://x.com/physical_int/status/2034728220818641363



扫描二维码,在手机上阅读

Physical Intelligence:RT @StanfordMSL的π项目,但让它飞起来✈️ 我…

Figure:在工作中连续看了4个小时的Helix 2.5在家中的安装视频…

评 论
评论已关闭