摘要
针对高参数大语言模型在词义消歧任务中计算成本高的问题,本研究探讨低参数模型(<4B)通过推理驱动的微调策略能否达到同等效果。利用增强后的 FEWS 数据集,对八种开源小模型进行微调。结果表明,结合邻词分析的思维链推理使小模型在零样本设置下性能媲美 GPT-4-Turbo。Gemma-3-4B 和 Qwen-3-4B 在未见词义上表现优异,且在跨领域测试中展现出强大的适应性,证明了以推理为中心的微调可显著降低资源消耗并保持高精度。
AI 推荐理由
论文核心在于利用思维链推理提升小模型词义消歧能力,直接研究推理机制。
研究机构
英国威尔士大学计算机科学系
论文信息