摘要
基于大语言模型的科学代理虽具备自主研究能力,但其安全层与核心推理过程往往割裂,导致阶段性安全信号丢失及多步工具调用组合产生有害后果。为此,本文提出 SciTrace 框架,将安全推理编织进代理流程的每一阶段。该框架包含两种互补机制:一是“安全内在推理循环”,在各阶段维持累积风险状态并进行联合 deliberation;二是“组合工具链验证器”,在执行前进行轨迹感知检查,捕捉单步过滤无法检测的多步风险。实验表明,SciTrace 在多种骨干模型上均实现了最先进的安全性,显著提升了工具调用安全与对抗鲁棒性,同时保持了科学输出质量。
AI 推荐理由
论文提出将安全推理深度融入科学发现代理的每个思考阶段,核心在于改进推理机制。
研究机构
Carnegie Mellon University
论文信息