论文
从轨迹到证据:工业研究代理的可审计实验记录
From Trajectories to Evidence: Auditable Experimental Records for Industrial Research Agents
摘要
研究代理越来越多地在工业推荐环境中进行多轮机器学习实验,并保留结果轨迹以指导后续决策。然而,完整的轨迹并不自动成为证据:生成的工件可能不受支持或不完整,执行的回合可能无效或混乱,并且后来的修改可能会掩盖早期的发现。我们研究\textbf{轨迹到证据的转换},询问一个完整的研究过程实际上已经建立了什么。我们引入了一个基于证据的框架,它将后续工件的有限验证与执行后声明资格结合起来。上下文隔离的生成-验证-修复流程在发布之前检查工件是否存在证据违规和缺失的下游需求。执行后,有效性和归因检查会整合各轮证据,将干预级别的声明限定为可操作的修复、诊断保护或保留的发现,并将已承认的声明保留为具有明确出处和适用性边界的可审计记录。随后,混合 LLM 辅助控制器根据可用的目标证据应用、推迟或拒绝记录。记录审核描述了哪些声明通过了资格认证,而下游诊断则将肯定的适用性判断确定为被测试控制器的瓶颈。在论文到目标的适应过程中,后面的几轮通常会在第一轮的基础上有所改进,而最后几轮的表现往往会低于早期的最佳成绩,从而暴露出非单调的轨迹演化。通过完整工作流程产生的候选者相对于部署的基线也产生了积极的在线提升。