环境动态变化下的上下文强化学习研究综述
随着决策预训练Transformer、算法蒸馏、长上下文元强化学习等技术的发展,上下文强化学习(ICRL)领域重新获得关注。ICRL指预训练或微调的决策模型能够从交互上下文中推断潜在任务规则并改进未来行为,而无需在测试时更新参数。现有研究主要围绕预训练目标、架构设计、上下文格式等方面展开,但对非平稳环境下的ICRL研究仍相对不足。
在动态变化的环境中,累积的上下文不仅是关于固定任务的证据:奖励函数、状态转移机制、观测通道等都可能与当前环境模式失配。先前有用的上下文可能变得陈旧甚至产生误导,也可能在旧模式重现时重新发挥作用。本文首次系统性地将非平稳ICRL定义为“在部署策略参数固定的情况下通过上下文适应环境变化”的问题,要求策略同时推断当前决策规则及其累积证据中仍支持该规则的部分。
研究从三个维度梳理文献:环境变化的内容(奖励、转移函数等)、变化发生的方式(突变/渐变)、以及智能体对变化的可观测程度。同时建立了与元强化学习、决策序列建模、检索增强强化学习等领域的理论联系,为动态环境中的持续学习提供了新的研究框架。