test-time reinforcement learning self-improvement multimodal models metacognition text-to-image generation
摘要

现有统一多模态模型在文本生成图像任务中的测试时扩展方法主要依赖搜索或采样策略,仅能实现实例级改进,难以从 prior 推理中学习并积累知识。为此,本文提出 Meta-TTRL,一种元认知测试时强化学习框架。该框架利用模型内在的元知识监控信号指导测试时参数优化,实现自我改进及能力级提升。实验表明,该方法在多个基准测试中显著优于现有方法,并揭示了元认知协同是实现有效测试时强化的关键。

AI 推荐理由

论文提出元认知框架实现测试时自我改进与能力进化,核心聚焦自我进化机制。

研究机构
中国科学院自动化研究所
论文信息
作者 Lit Sin Tan, Junzhe Chen, Xiaolong Fu, Lichen Ma, Junshi Huang et al.
发布日期 2026-03-16
arXiv ID 2603.15724
相关性评分 9/10 (高度相关)