强化学习在金融交易中的核心难点是兼顾收益上行与回撤控制。仅追求利润的策略在上涨趋势中往往退化为被动的多头持仓,而在波动剧烈时,过度惩罚风险的奖励会导致策略过于保守,错失机会。为了解决这一矛盾,本文提出 PPO‑HRAP,一种将 Proximal Policy Optimization (PPO) 与可解释的状态感知先验相结合的混合策略。
方法概述
- 观测空间:同时包含市场特征(如价格、波动率)和组合状态变量(持仓、资金等)。
- 奖励函数: $$ R = \underbrace{\log\,\frac{V_{t+1}}{V_t}}_{\text{组合对数收益}} - \lambda_{dd}\,\mathbf{1}_{\text{VIX}>\theta}\,\Delta\text{DD} - \lambda_{exp}\,(e_t - e^{*})^2 - \lambda_{turn}\,\text{Turnover}_t $$ 其中,$\Delta\text{DD}$ 为当日回撤增幅,$e_t$ 为实际敞口,$e^{*}$ 为基于当前波动率 regime 推导的目标敞口。
- 动作融合:策略输出 $a^{\text{PPO}}_t$ 与 regime‑derived 目标敞口 $a^{\text{regime}}_t$ 按权重 $\alpha$ 混合得到最终执行动作 $a_t = (1-\alpha) a^{\text{PPO}}_t + \alpha a^{\text{regime}}_t$。
实验结果
在 2020‑2022 年 SPY 的持出窗口上,PPO‑HRAP 获得:
- 总收益 27.62%(年化 8.48%)
- Sharpe 0.6447,Sortino 0.8588,Calmar 0.4592
- 最大回撤从 Buy‑and‑Hold 的 34.10% 降至 18.47%
跨五个随机种子,平均总收益 $0.2725 \pm 0.0109$,平均 Sharpe $0.6219 \pm 0.0565$,表现稳定。单次跨资产实验(QQQ、DIA)显示 PPO‑HRAP 在总收益和 Sharpe 上均排名第一。
局限与展望
尽管混合策略显著提升了风险调整后收益,但仍存在换手率偏高的问题,且跨资产的鲁棒性仅有单次实验支撑,需进一步验证。
点评:PPO‑HRAP 通过将波动率感知的 regime 先验嵌入 PPO 框架,实现了收益与风险的有效平衡,为实际交易系统提供了可解释且具备风险控制能力的方案,但后续工作应聚焦降低交易成本并提升跨资产的通用性。