RxBrain:首个融合语言推理与视觉想象的具身认知基础模型

arXiv·4 天前

近日,arXiv平台发布了一项具身认知领域的重要研究成果——RxBrain模型。该研究团队创新性地提出了Hy-Embodied-RxBrain架构,这是首个将语言推理与视觉想象能力深度融合的具身认知基础模型。

与传统视觉语言模型侧重场景理解和文本决策不同,RxBrain采用统一的多模态混合Transformer架构,在单一规划序列中同时处理语言、图像和视频的理解与生成任务。模型的核心突破在于:语言部分负责提供计划的抽象结构,包括任务分解、规划原语、约束条件和时序逻辑;而视觉想象部分则通过世界状态预测和联合子目标规划,将抽象计划与具体的物理状态变化相连接。

为训练这一能力,研究团队构建了自动化流水线,能够将具身视频分解为规划步骤,并与视觉状态转换对齐,生成联合文本-视觉规划监督数据。此外,团队还推出了RxBrain-Bench评估基准,专门测试模型是否真正实现了文本与视觉组件的联合表征能力。

实验结果表明,RxBrain不仅保持了具身理解和生成能力,还能生成耦合文本推理、世界状态预测和联合子目标规划的综合计划。更值得关注的是,该模型已成功扩展至连续机器人动作生成任务,在未经大规模动作数据预训练的情况下,展现出有前景的真实机器人性能。这项研究为具身认知基础模型的发展迈出了重要一步,为未来智能体在物理世界中执行复杂任务提供了新的技术路径。

具身认知多模态AI基础模型机器人规划视觉推理

原文来源:https://arxiv.org/abs/2607.14187

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回