HIL-ResRL:一小时真机强化学习微调,成功率超95%的视觉语言模型外挂方案
近期,一项名为HIL-ResRL的创新框架在arXiv上发布,旨在解决视觉语言模型在真实物理环境中执行复杂任务时面临的泛化挑战。该框架核心在于将人类交互式学习与残差强化学习相结合,形成一种“即插即用”式的增强方案。传统方法往往需要大量标注数据或漫长的仿真训练,而HIL-ResRL仅需约一小时的真人示范与真机交互微调,就能显著提升模型在陌生场景下的任务成功率。实验显示,经过该框架微调的模型,在物体抓取、摆放等操作任务中,成功率从基线水平的不足70%大幅提升至95%以上。该方法被研究者比喻为VLA模型的“外挂神器”,因其不依赖修改原始模型参数,而是通过学习残差策略来补偿基础模型的不足,具有部署灵活、样本效率高的特点,为机器人操作、具身智能等领域的实际应用提供了新思路。