Psi R0 – 灵初智能推出的端到端具身模型-六六导航站

Psi R0 – 灵初智能推出的端到端具身模型

2025-01-02 15:43:50 小编：六六导航站

Psi R0是什么

Psi R0是灵初智能发布的首个基于强化学习的端到端具身模型。支持双灵巧手协同进行复杂操作，能够将多个技能串联混训，生成具有推理能力的智能体，完成并闭环长程灵巧操作任务。Psi R0能实现跨物品、跨场景级别的泛化，具备较强的泛化能力和较高的鲁棒性。

Psi R0的主要功能

双灵巧手协同操作：Psi R0支持双灵巧手协同进行复杂操作，能完成多步骤的长程灵巧任务。多技能串联混训：模型能将多个技能串联混训，生成具有推理能力的智能体，完成并闭环长程灵巧操作任务。跨物品、跨场景泛化：Psi R0能实现跨物品、跨场景级别的泛化，具有较强的泛化能力和较高的鲁棒性。基于仿真数据训练：Psi R0使用海量仿真数据训练出双手操作的智能体，通过双向训练框架串联多技能，在业界率先完成开放环境中的长程任务。解决奖励函数设计难题：该技能训练框架从物体时空轨迹抽象出关键信息以构建通用目标函数，解决了奖励函数难设计的问题。后训练阶段优化：在后训练阶段，通过少量高质量真机数据对齐，进一步提升长程任务的成功率。自主切换技能能力：双向训练框架中的转移可行性函数能够微调技能以提高串联的成功率与泛化性，同时赋予模型自主切换技能的能力，在遭遇操作失败时能够迅速调整策略，确保高成功率。

Psi R0的技术原理

强化学习（RL）：Psi R0是一个基于强化学习的端到端具身模型，使用海量仿真数据训练出双手操作的智能体。技能训练框架：这一技能训练框架从物体时空轨迹抽象出关键信息以构建通用目标函数，解决了奖励函数难设计的问题。

Psi R0的应用场景

电商场景：Psi R0能应用于电商行业中的商品打包作业，涉及到对上万件商品进行抓取、扫码、放置和塑料袋打结等多个操作。Psi R0能使用双灵巧手流畅地完成这一系列动作，在客户现场取代一个完整的工位。工厂产线组装：在制造业中，Psi R0可以用于工厂产线的组装工作，完成复杂的长程任务作业，如部件的抓取、组装和放置等。服务业拣货打包：Psi R0也适用于服务业中的拣货和打包任务，能处理长程任务作业，如抓取、扫码、放置等。家居环境清洁整理：Psi R0还可以在家居环境中进行清洁和整理工作，处理日常的家务任务。