摘要
个人 AI 代理因重复调用 LLM 产生高昂成本。现有缓存方法因优化目标错误(追求分类准确率而非键的一致性)而失效。本文提出 W5H2 结构化意图分解框架,将缓存键评估转化为聚类评估。实验表明,该方法在多个基准测试中显著优于 GPTCache 和大参数 LLM,推理速度提升千倍以上。通过五级级联架构,可本地处理 85% 的交互,预计降低 97.5% 的成本,并提供风险控制的预测保证。
AI 推荐理由
论文核心研究 Agent 缓存机制(记忆检索),提出结构化意图规范化以解决记忆键一致性问题。
研究机构
未提供具体单位
论文信息