摘要
针对现有基于推理的图像编辑器对所有指令采用固定推断流程的问题,本文提出 PhysEdit 框架,强调空间与时间轴上的自适应性。该框架包含两个无需重训练即可组合的推理时模块:复杂度自适应推理深度(CARD)根据指令和参考图像预测编辑复杂度,动态分配推理步数与令牌长度;空间推理掩码(SRM)利用交叉注意力提取空间先验,将推理限制在语义相关区域。实验表明,该方法在提升指令遵循度的同时显著加速推理过程。
AI 推荐理由
论文核心提出自适应时空推理机制,动态调整推理深度与空间范围,属于推理能力研究。
研究机构
iFLYTEK
Aegon THTF
论文信息