论文
针对执行感知的预算子集细化 LLM 研究构想
Budgeted Subset Refinement for Execution-Aware LLM Research Ideation
摘要
大语言模型 (LLM) 可以产生对专家审稿人来说显得新颖的研究想法,但最近的工作也表明,此类想法往往缺乏多样性,很难被 LLM 可靠地评估,并且可能无法转化为强有力的执行项目。本文评估了预执行脚手架问题的受控代理基准:给定 LLM 生成的研究想法的嘈杂池,系统应该如何分配有限的细化工作,以便在固定的标题下为人类研究人员构建更强大、更多样化、更具执行意识的投资组合?我们引入了预算子集细化,这是一系列策略,仅细化选定的候选子集,而不是统一细化所有候选者。在跨 10 个随机种子和 10 个研究构思环境的统一共享候选池评估中,仅原始生成和重新排名不会在基准标题下产生具有研究性的非重复想法,而对于强大的代理评级投资组合来说,细化是必要的。统一细化会产生强烈的个人想法,但并不是最佳的投资组合级别的计算分配。随机 k 细化是一个强大的低成本基线,而多样性感知 MMR-k 细化提供了最佳的整体代理权衡:最高的研究强非重复产量、成功方法中最低的重复率以及每个研究强非重复想法的最佳成本。对平衡的 72 项样本进行的盲法外部法官稳健性检查支持独立模型系列中的广泛细化效果,同时表明细化策略中每个项目的排名因法官而异。这些结果表明,LLM 研究构思系统不仅应作为创意生成器进行评估,还应作为预算支持分配系统进行评估。这些声明的范围仅限于代理评级的投资组合质量,不能替代专家评审或基于执行的验证。