论文

EPOCH:以证据治理提升 AI 搜索与科学发现的可靠性

EPOCH: Reliable Discovery through Evidence-Governed Search

智能体系统Agent 动作执行与治理

摘要

人工智能研究智能体越来越多地用于搜索程序、数学结构和证明。然而,现有系统通常会优化评估者的反馈,而没有充分控制反馈的解释、质疑和重用方式。因此,有前途但脆弱的候选者可以被宣传为发现,而基准改进、有限证书和定理级别的主张很容易混为一谈。我们引入了 EPOCH,这是一种旨在缩小这一差距的证据治理架构。 EPOCH 通过结合显式任务合同、类型为记忆、主动伪造、准入检查和独立重播来实现证据管理的发现循环,以便根据其支持的声明的强度和范围来评估每个候选者。 EPOCH 在 AlgoTune 上实现了最先进的总体性能,大大超过了平均归一化分数的最强基线(0.65 与 0.53),并在内部 Math14 套件上获得了最高平均分数(0.57)。它进一步显示了在官方测试回放下良好的 保留测试 行为,并在 AgentHPO 上的描述性汇总中领先。在十个发现问题中,EPOCH 提供了重大的特定于任务的进步,包括改进的可执行结构、优化的算法、反例和证明支持的结果。这些进步证明了其将搜索转化为跨数学和计算领域的具体进展的能力。总之,结果表明证据治理是人工智能研究智能体的必要步骤,它不仅产生更强大的解决方案,而且产生更值得信赖的科学发现。

EPOCH:以证据治理提升 AI 搜索与科学发现的可靠性:论文原图
图 5:要素共享及其成本缩放。共享因子计算一次,在 $k$ 输出之间重复使用,然后不计算。加上开通成本 $c$ 和每次使用成本 $u$,相对节省为 $(k-1)c/[k(c+u)]$,并且随着使用次数的增加而增加。伪代码保留输入并恢复辅助。