论文

ForeSci:评估LLM智能体的前瞻性AI研究判断

ForeSci: Evaluating LLM Agents for Forward-Looking AI Research Judgment

智能体系统Agent任务评测

摘要

AI研究常常需要在未来证据尚不存在时做出决策:攻克哪个瓶颈、追求哪个方向,或项目应如何定位。我们提出ForeSci,一个时间上受控的基准,用于评估LLM智能体能否基于历史证据做出这类前瞻性研究判断。ForeSci包含横跨四个快速发展的AI领域和四个决策家族的500个任务。每个任务都配有一个与截止时间对齐的离线知识库;截止时间之后的论文在生成期间被隐藏,仅用于验证。为避免随机的未来事件预测,任务从截止时间前的分类体系分支和证据信号中派生,且答案生成骨干模型的选择先于任务截止时间。我们在四个骨干模型上评估了原生LLM、Hybrid RAG以及三种研究型智能体适配方案。结果表明,显式的证据组织能改善可追溯性和事实支撑,但收益在很大程度上取决于决策家族。诊断揭示了一种反复出现的证据-决策脱钩现象:智能体可能引用了相关证据,却预测出错误的研究对象。ForeSci将前瞻性AI研究判断转化为一个受控基准,用于把研究智能体作为决策系统加以评估。

ForeSci:评估LLM智能体的前瞻性AI研究判断:论文配图
图1:ForeSci四类决策任务示例:方向预测、瓶颈-机会发现、战略性科研规划与考虑发表场所的研究定位。