环境动态变化下的上下文强化学习研究综述

arXiv·6 天前

随着决策预训练Transformer、算法蒸馏、长上下文元强化学习等技术的发展,上下文强化学习(ICRL)领域重新获得关注。ICRL指预训练或微调的决策模型能够从交互上下文中推断潜在任务规则并改进未来行为,而无需在测试时更新参数。现有研究主要围绕预训练目标、架构设计、上下文格式等方面展开,但对非平稳环境下的ICRL研究仍相对不足。

在动态变化的环境中,累积的上下文不仅是关于固定任务的证据:奖励函数、状态转移机制、观测通道等都可能与当前环境模式失配。先前有用的上下文可能变得陈旧甚至产生误导,也可能在旧模式重现时重新发挥作用。本文首次系统性地将非平稳ICRL定义为“在部署策略参数固定的情况下通过上下文适应环境变化”的问题,要求策略同时推断当前决策规则及其累积证据中仍支持该规则的部分。

研究从三个维度梳理文献:环境变化的内容(奖励、转移函数等)、变化发生的方式(突变/渐变)、以及智能体对变化的可观测程度。同时建立了与元强化学习、决策序列建模、检索增强强化学习等领域的理论联系,为动态环境中的持续学习提供了新的研究框架。

强化学习上下文学习非平稳环境元学习决策模型

原文来源:https://arxiv.org/abs/2607.11906

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回