Reinforcement Learning Financial Trading Model Predictive Control Inference-Time Optimization
摘要

针对投资组合管理中强化学习代理通常作为静态策略部署、无法在推理时利用价格预测的问题,本文提出 FPILOT 框架。该框架受模型预测控制启发,利用预测模型生成的多步价格轨迹构建想象回报目标,并在执行前对策略进行推理时优化。该方法无需重新训练即可适配任何预训练代理。在 TradeMaster DJ30 基准上的评估显示,FPILOT 显著提升了总回报及风险调整后指标,且性能随预测质量提高而增强。

AI 推荐理由

论文提出基于预测轨迹进行推理时多步优化,核心在于动态规划与决策生成。

研究机构
Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign Siebel School of Computing and Data Science
论文信息
作者 Eun Go, Rohan Deb, Arindam Banerjee
发布日期 2026-05-12
arXiv ID 2605.12653
相关性评分 9/10 (高度相关)