摘要
本文针对 SAIR 等式理论竞赛,系统研究了形式化数学推理中的提示工程。任务涉及判断等式定律在广义群上的蕴含关系。研究测试了超 40 种提示变体,发现存在“单提示上限”:即便经过大量工程优化,硬样本准确率仍饱和于 60%-79%。文章揭示了导致该上限的三大机制:真值情况的数学不可判定性、复杂规则系统削弱弱模型性能、以及提示顺序与注意力的脆弱交互。最佳提交方案较基线提升了 19.5 个百分点。
AI 推荐理由
论文核心研究提示工程对 LLM 数学推理能力的限制与影响机制。
研究机构
Bytepro AI
Mazatlán, Sinaloa, Mexico
论文信息