摘要
大型语言模型代理可自动化数据科学工作流,但因缺乏统计知识及工具检索困难,导致 R 语言中严谨的统计方法未被充分利用。现有检索增强方法忽视数据分布,匹配效果不佳。本文提出 DARE,一种轻量级即插即用检索模型,将数据分布信息融入函数表示以优化 R 包检索。主要贡献包括:构建包含 8191 个高质量 CRAN 包的 R 包知识库 RPKB;开发融合分布特征与元数据的嵌入模型 DARE;以及面向 R 的代码生成代理 RCodingAgent。实验表明,DARE 在参数更少的情况下,检索性能显著优于现有开源模型。
AI 推荐理由
论文核心解决 Agent 在 R 生态中的工具(包/函数)检索与选择问题,直接提升技能应用能力。
研究机构
1
2
1,2
论文信息