三阶段基础模型:AI驱动的个性化投资组合管理,兼顾税务优化
近日,一项发布于arXiv的研究提出了一种创新的三阶段深度强化学习系统,旨在解决以往金融强化学习研究中普遍存在的三大局限:资产锁定、单一目标设定和静态用户模型。该系统通过分阶段设计,实现了更灵活、个性化且税务敏感的投资组合管理。
第一阶段采用自监督学习预训练一个跨资产编码器,不依赖特定股票代码,而是通过50维元数据向量泛化到任何公开交易资产。该阶段还首次引入基于T5的时间序列基础模型Chronos,通过门控机制融合,增强了模型对多资产时序数据的理解能力。
第二阶段利用近端策略优化(PPO)微调一个混合专家(MoE)投资组合执行器,同时优化六种不同的投资目标,包括短期阿尔法收益、短期增益、长期增益、资本保值、税务损失收割和仅长期收益。MoE架构为每种目标分配专用专家头,并通过意图路由器根据当前市场状态动态混合专家输出,避免了多目标间的梯度冲突。
第三阶段添加了一个轻量级个性化层,在推理时通过仅76参数的LoRA模块,根据真实经纪交易历史进行微调,从用户交易行为中推断投资意图,替代传统问卷方式。系统还支持自然语言目标解析,允许用户自由输入投资目标并转换为结构化参数。
该研究为AI在金融投资领域的应用提供了新思路,特别是在个性化适配和税务优化方面展现出潜力。