摘要
许多手语翻译系统错误地假设手势片段直接映射为口语词汇,忽略了手语者利用语境、空间和动态即时构建意义的特性。本文重审该任务,主张其本质是跨模态推理而非简单的视频转文本。为此,我们提出一种推理驱动的框架,利用有序的潜在思维序列作为视频与生成文本间的显式中间层,逐步提取并组织意义。此外,采用“先规划后接地”的解码策略,模型先确定表达内容再回溯视频寻找证据,显著提升了连贯性与忠实度。我们还发布了新的大规模数据集,实验表明该方法在多个基准上均优于现有技术。
AI 推荐理由
论文核心提出基于推理的框架,利用潜在思维序列和跨模态推理解决手语翻译问题。
研究机构
香港理工大学
四川大学
论文信息