市场在变,策略不死:ReCAP框架下的制度自适应投资组合管理
“Regime-Adaptive Continual Learning for Portfolio Management”

【 扫描文末二维码加入星球获取论文 】
摘要
金融市场本质上具有非平稳性,表现出频繁的制度转变和结构性变化,这使得传统的投资组合管理(PM)方法失效。现有的补救措施,如滚动窗口重训练和朴素的在线微调,分别受困于高计算成本和知识利用不足,导致回报率低且适应性有限。持续学习(CL)提供了一种有前景的范式,它使交易智能体能够跨顺序任务积累和迁移知识。
本文提出了ReCAP(Regime-aware Continual Adaptive Portfolio management,即制度感知的持续自适应投资组合管理),这是一个将CL整合到PM中以应对动态金融环境挑战的新颖框架。ReCAP采用自适应制度检测模块,将历史市场数据分割成可变长度的制度,从而能够对制度特定的策略向量进行学习,并构建一个策略库。在持续交易过程中,一个制度门控模块根据当前市场状态自适应地组合策略库中的策略向量,促进对新检测到的制度的快速适应。只有制度门控和当前制度的策略向量会被持续更新,以有效保留有用的知识。
在五个真实世界数据集上的大量实验表明,ReCAP持续优于流行的基线方法,在长期投资视野中实现了卓越的回报,并对制度转变实现了快速适应。
简介
股票市场总市值超过90万亿美元,投资组合管理(PM)通过在不同资产间动态配置资本,在最大化收益和控制风险方面发挥着关键作用。随着深度学习和强化学习(RL)的进步,量化交易彻底改变了PM。然而,金融市场具有非平稳性和频繁的结构性转变,导致交易策略性能快速下降,这种现象被称为“阿尔法衰减”——市场会适应并套利掉有利可图的策略。
持续学习(CL)扩展了静态学习框架,使系统能够跨任务序列学习,逐步积累和迁移知识。然而,CL在PM中的应用尚不充分。本文提出ReCAP,将PM重构为CL问题,通过自适应制度检测、策略库和制度门控模块,实现高效的知识积累和快速适应。

本文主要贡献:
-
明确将持续PM问题建模为制度感知的决策任务序列;
-
提出ReCAP框架,整合自适应制度检测、制度特定策略学习和制度感知策略组合;
-
在五个真实数据集上验证了ReCAP的优越性能。
相关工作
投资组合管理
传统PM方法可分为规则型方法和RL方法。规则型方法包括B&H、CRP、EG、UP、OLMAR、WMAMR等,基于固定规则或在线学习。RL方法如A2C、PPO、SAC、EIIE、SARL、Cross-Insight、AlphaGAT等,通过学习状态-动作映射来优化决策。然而,这些方法通常假设市场是平稳的,难以应对制度转变。
持续学习
CL旨在解决灾难性遗忘问题,使模型能够顺序学习多个任务。主要策略包括正则化方法(如EWC)、回放方法(如ER)和架构方法(如CoR)。回放方法在持续RL中表现出色,而正则化方法通常需要更大容量。现有工作较少考虑PM中的制度动态特性。
制度检测
制度检测方法包括基于统计的方法和基于学习的方法。基于统计的方法如CUSUM、Bai-Perron检测,利用资产价格的统计特性识别结构性突变。基于学习的方法如隐马尔可夫模型,学习状态间的概率转移。ReCAP采用CUSUM变体进行自适应制度检测。
问题定义
投资组合管理(PM)
交易智能体与金融市场交互,可建模为马尔可夫决策过程(MDP)(S,A,R,
T,𝛾)。状态 s_t 由多资产市场特征提取得到,动作 w_t 是资产权重向量(非负且求和为1),奖励 r_t = log(V_t / V_{t-1}) 是对数投资组合回报。目标是在初始资本 V_0 下最大化长期累积回报。
持续投资组合管理
金融市场是非平稳的,可被视为一系列制度 {𝜏1, 𝜏2, . . . , 𝜏𝑀} 的序列。每个制度 𝜏k 对应一段具有相对稳定统计特性的连续时间段。因此,问题建模为具有动态MDP的持续强化学习(CRL)问题:(S, A, R_k, T_k, 𝛾)。每个制度 𝜏k 内的转移动态 T_k 和奖励函数 R_k 可能不同,智能体需要面对一系列相关的PM任务。
金融市场可视为一系列制度 {𝜏_1, 𝜏_2, . . . , 𝜏_𝑀}的序列,每个制度 𝜏_k 对应一段具有相对稳定统计特性的时间段。这被建模为动态MDP问题 (S,

其中 𝜋_𝑘−1 是在制度 𝜏_k 中使用的策略,|𝜏_k| 是制度内的交易步数。
ReCAP
概览
ReCAP框架包含两个主要阶段:预训练阶段和持续交易阶段。在预训练阶段,系统在长时间跨度的历史数据上训练基础策略,使用自适应制度检测模块(ARD)识别制度断点,然后为每个制度微调策略并构建策略库。在持续交易阶段,ARD实时检测制度转变,制度门控模块(RGM)根据当前市场状态动态组合策略向量,生成最终的策略参数。只有RGM和当前制度的策略向量被持续更新,基础策略和策略库保持固定,以防止灾难性遗忘。



自适应制度检测模块(ARD)
ARD采用累计和(CUSUM)算法的变体来识别市场断点。对于一个制度敏感标量特征 u_t,统计量定义为:

其中 𝜇_0 是参考均值,𝜅 > 0 是漂移参数,控制检测灵敏度。当 S_t 超过阈值 h 时,表明制度改变。
ARD并行应用于多个市场级特征,包括VIX、动荡指数、布林带、5日调整价格回报、RSI-30。取所有检测断点的并集 C,从而将数据分割为制度序列 𝜏_1,𝜏1_M。


在预训练阶段,ARD对历史数据进行离线识别。在持续交易阶段,ARD对实时流数据进行在线检测。
策略向量和策略库
预训练完成后,系统在历史数据上获得了制度序列。对每个检测到的制度 𝜏(0, 𝑗 ) ,微调基础策略 𝜃_0 得到制度适配策略 𝜃_𝑗。定义策略向量 d_j = 𝜃_𝑗 – 𝜃_0,代表从基础策略到特定制度的适配方向。所有策略向量构成策略库 D = [d1, . . . , d𝐾 ]。

通过自适应合并机制维护策略库的紧凑性:若两个向量 d_i 和 d_j 的余弦相似度超过阈值 𝛿_s=0.5,则合并:

同时,为去除噪声,丢弃 ℓ_2 范数小于0.01的非信息性策略向量。
制度门控模块(RGM)
在持续交易阶段,每个时间步 t,RGM接收市场级制度特征向量 m_t,通过一个神经网络 输出权重向量:

该权重决定了策略库中各策略向量在当前市场状态下的注意力。
最终策略参数由基础策略、策略库和RGM权重动态组合:

其中 D~ = [D, d_new,t] 包含策略库和当前制度的新策略向量。
状态 s_t 输入策略网络 f_𝜃,输出经Softmax得到资产权重:

在更新过程中,只有RGM参数 𝜙 和当前制度的新策略向量 d_new 被更新,基础策略 𝜃_0 和策略库 D 保持固定。当新制度结束后,d_new 根据平均注意力权重和 ℓ_2 范数判断是否加入策略库,再按相似度准则进行合并或插入。整个过程被总结为算法1(预训练)和算法2(持续交易)。
实验
实验设置
数据集:使用5个真实世界数据集,涵盖美国和日本股票市场以及商品ETF。DOW30包含29只股票,NAS100包含73只股票,SP500包含398只股票,NIKKEI30包含29只日本股票,COMMODITY_ETF包含7个商品ETF。数据跨度2008年5月1日至2025年4月29日,共17年。前12年(至2020年4月30日)用于离线训练,后5年用于在线评估。每日数据包含26个特征。

评估指标:累积回报(CR),夏普比率(SR),最大回撤(MDD)。持续学习指标包括平均性能(AP)、遗忘(FG)和前向迁移(FT)。
基线方法:包括6种规则型方法(B&H、CRP、EG、UP、OLMAR、WMAMR)和7种RL方法(A2C、PPO、SAC、EIIE、SARL、Cross-Insight、AlphaGAT),以及5种CL策略(Retrain、Finetune、ER、EWC、CoR)。
实现细节:基于PyTorch和FinRL实现,RL方法使用10个随机种子。actor和critic网络为2层MLP,嵌入维度64,批次大小256。使用Adam优化器,学习率 $10^{-4}$,交易成本10个基点。
对比分析
在三个美国市场数据集上,ReCAP均取得最佳表现。在DOW30上,ReCAP的累积回报为96.76%(次优Cross-Insight为90.31%),夏普比率为1.00(次优为0.93),最大回撤为-17.58%(次优为-19.12%)。在NAS100上,ReCAP的累积回报为164.89%(次优A2C为126.10%),夏普比率为1.14(次优为0.93),最大回撤为-23.86%。在SP500上,ReCAP的累积回报为145.02%(次优B&H为111.00%),夏普比率为1.14(次优为1.03),最大回撤为-19.19%。

在非美国市场上,NIKKEI30上ReCAP的累积回报为133.29%(次优Cross-Insight为127.70%),夏普比率为1.00。COMMODITY_ETF上ReCAP的累积回报为97.80%(次优A2C为92.42%),夏普比率为0.95。投资组合价值曲线显示,ReCAP在牛熊市场中均持续超越其他方法,且随着交易时间拉长,优势愈发明显。


在持续学习指标对比中,ReCAP的平均性能(AP)显著领先。在DOW30上,ReCAP的AP为24.92%,而次优的ER为18.47%。在NAS100上,ReCAP的AP为39.03%,是Finetune(24.59%)的1.58倍。在SP500上,ReCAP的AP为47.18%,而其他方法最高仅为22.87%。在遗忘(FG)和前向迁移(FT)指标上,ReCAP与最优方法持平或略优。

增加交易成本(+5bps、+10bps)后,ReCAP仍保持显著优势。在NAS100上,+5bps后ReCAP的CR为143.48%,次优为104.71%;+10bps后ReCAP的CR为130.64%,次优为87.83%。
消融分析
在NAS100上比较完整模型与三个变体:w/o-ARD(使用固定长度窗口替代自适应检测)、w/o-PL(仅保留最新策略向量,丢弃策略库)、w/o-RGM(随机组合策略向量,无门控机制)。结果如图4所示。

移除ARD导致性能下降最严重,完整模型CR为164.89%,w/o-ARD降至125.58%。移除策略库(w/o-PL)性能次之,CR降至149.56%。移除RGM(w/o-RGM)CR降至155.59%。完整模型在所有指标(CR、SR、MDD上均最优),证明了三个组件缺一不可。
参数敏感性
对ARD模块的漂移参数 𝜅 和阈值 h 进行了敏感性测试。固定 h=2.5𝜎 改变 𝜅,𝜅 =0.3𝜎 时CR为139.14%,𝜅 =0.5𝜎 时为164.89%,𝜅 =0.7𝜎 时为153.05%。固定 𝜅=0.5𝜎 改变 h,h=2.0𝜎时CR为172.07%,h=2.5𝜎 时为164.89%,h=3.0𝜎 时为132.61%。所有配置下CR和SR均显著优于基线,表明ReCAP具有较强的鲁棒性。

更多讨论
策略库演化:分析显示,策略库从初始12个向量扩展到37个检测制度后仅增长到22个向量,说明合并机制有效维持了紧凑性。门控权重高度集中于少数向量,前五名占比超过85%,表明模型确实学到并复用了少量核心策略。
匹配窗口比较:在NAS100上,将ReCAP与使用相同回滚窗口长度的Finetune和Retrain对比,ReCAP的CR(164.89%)仍远高于Finetune(108.37%)和Retrain(107.09%),证明了策略库和门控机制带来的额外优势。
任务划分影响:实验表明,与CUSUM匹配的ARD分割方式优于固定窗口分割,且策略库和门控机制在短窗口下提升不显著,但在长窗口下增益明显,进一步验证了其长期知识积累能力。
总结
本文提出ReCAP框架,通过持续学习范式应对金融市场的非平稳性。ReCAP整合了自适应制度检测、策略库和制度门控机制,使智能体能够动态检测市场变化、保留历史经验并快速适应新制度。在五个真实数据集上的实验表明,ReCAP在盈利能力、风险控制和持续学习指标上均显著优于各种基线方法。
局限性:
1) 统计断点检测可能难以捕捉渐进或微妙的市场转变,特别是在高频场景下;
2) 策略库维护策略基于余弦相似度,可能将参数相似但实质不同的策略合并,或丢弃有用但罕见的策略;
3) RGM提供了初步的可解释性,但仍需更强的解释性和金融透明度;
4) 实验主要集中在日频交易,其在更高频数据上的泛化能力有待验证;
5) 在要求极快适应的短时间跨度交易中,ReCAP可能效果有限。
未来工作
探索更数据驱动的制度分割方法、跨更多市场的评估、提升可解释性和风险控制,以及扩展以更好地支持短期交易。

我们致力于人工智能、量化交易领域前沿研究,分享前沿论文、模型代码、策略实现。如有相关需求,请私信与我们联系。
请加微信“LingDuTech163”,或公众号后台私信“联系方式”。
关注【灵度智能】公众号,获取更多AI资讯。