摘要
针对投资组合管理中强化学习代理通常作为静态策略部署、无法在推理时利用价格预测的问题,本文提出 FPILOT 框架。该框架受模型预测控制启发,利用预测模型生成的多步价格轨迹构建想象回报目标,并在执行前对策略进行推理时优化。该方法无需重新训练即可适配任何预训练代理。在 TradeMaster DJ30 基准上的评估显示,FPILOT 显著提升了总回报及风险调整后指标,且性能随预测质量提高而增强。
AI 推荐理由
论文提出基于预测轨迹进行推理时多步优化,核心在于动态规划与决策生成。
研究机构
Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign
Siebel School of Computing and Data Science
论文信息