NeFut Logo NeFut
EN 管理员登录

[AI学术] PPO-HRAP:一种用于风险控制交易的混合状态感知策略

发布于:2026-10-03 22:00 最后更新:2026-10-06 12:11
#Machine Learning #optimization #Artificial Intelligence

强化学习在金融交易中的核心难点是兼顾收益上行与回撤控制。仅追求利润的策略在上涨趋势中往往退化为被动的多头持仓,而在波动剧烈时,过度惩罚风险的奖励会导致策略过于保守,错失机会。为了解决这一矛盾,本文提出 PPO‑HRAP,一种将 Proximal Policy Optimization (PPO) 与可解释的状态感知先验相结合的混合策略。

方法概述

实验结果

在 2020‑2022 年 SPY 的持出窗口上,PPO‑HRAP 获得:

跨五个随机种子,平均总收益 $0.2725 \pm 0.0109$,平均 Sharpe $0.6219 \pm 0.0565$,表现稳定。单次跨资产实验(QQQ、DIA)显示 PPO‑HRAP 在总收益和 Sharpe 上均排名第一。

局限与展望

尽管混合策略显著提升了风险调整后收益,但仍存在换手率偏高的问题,且跨资产的鲁棒性仅有单次实验支撑,需进一步验证。

点评:PPO‑HRAP 通过将波动率感知的 regime 先验嵌入 PPO 框架,实现了收益与风险的有效平衡,为实际交易系统提供了可解释且具备风险控制能力的方案,但后续工作应聚焦降低交易成本并提升跨资产的通用性。

原文链接: https://arxiv.org/abs/2610.01325

[h] 返回首页