论文

Apodex Discovery:评估与构建发现型AI的现实基准与环境

Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence

智能体系统Agent任务评测长程任务评测

摘要

阿波罗计划之所以能登月,并非仅因其工程师能解出困难的方程,而是因为它把遥远的抱负转化为由明确目标、仿真、验证和反复纠正构成的任务架构。AI如今面临类似的转变:前沿模型在问题、工具和成功标准被明确给出后可以解决困难任务,但重要的现实挑战很少以可执行或可验证的形式出现。我们提出Apodex Discovery,一个通过重型求解器(heavy-duty solver)构建与评估发现型AI的框架,该系统由基础模型、harness、工具和控制策略组成,可开展长时间、有状态、可验证的探究。它包含三个核心组件。第一,问题侦察流程横跨16个板块调研了561个行业,汇集423个高价值现实问题,并为其首版选出20个。第二,统一的环境-任务-回合抽象提供数据、工具、约束、反馈、轨迹记录以及中间产物与最终提交的验证。第三,HDS6独立于最终任务成功与否,评估工具使用(Tools)、修复(Repair)、替代方案(Alternatives)、连贯性(Coherence)、证据(Evidence)与范围(Scope)。在AAV衣壳设计中,Apodex在活性、趋向性、结构预测与生成式设计上超越已发表最优水平7%。在药物重定位与复方改良任务中,专用生物医学环境使GPT-5.5与GPT-5.6-sol的平均归一化预测分较同一闭卷骨干分别提升2.5和7.6分。受控消融表明,固定的TRACES回合接口可将性能差异归因到具体求解器组件。Apodex Discovery将AI评估从预定义基准推向以真正发现为目标的可验证探究。