摘要
当前音频推理依赖大规模模型,难以在资源受限环境部署。本文提出 TinyGiantALM,一种面向效率的 15 亿参数紧凑模型。该模型摒弃暴力扩展,采用指令感知特征精炼框架,利用查询引导投影器和语义门控机制,根据用户意图过滤声学信号。在 MMAR 基准测试中,其零样本准确率达 46.4%,显著优于 70 亿至 130 亿参数的基线模型。尽管在逻辑叙事方面与超大模型仍有差距,但该架构在解耦多模态混合环境方面表现卓越,证明了通过架构精度可在边缘友好尺度上实现稳健感知能力。
AI 推荐理由
论文核心提出意图感知推理框架,旨在解决资源受限下的音频推理难题。
研究机构
越南科学翰林院,胡志明市,越南
越南国家大学,胡志明市,越南
论文信息