论文
智能体评估何时才算结束?结果终局性与跨单元分离
When Is an Agent Evaluation Over? Outcome Finality and Cross-Unit Separation
摘要
当前Agent评测通常对一次运行停止时可见的状态打分,并将这次运行计为一个试验。然而,将分数解释为最终结果需要两个条件:结果终局性与跨单元分离,而终点本身未必能证明它们。两者相互独立:解决一个延迟结果可以确定标签,但不同运行仍可能共享状态;隔离运行可以避免状态残留,但被评分结果可能仍未完成。我们提出一个完成性论证,规定每项判断需要什么证据,并主张只有当所有仍可能改变所声称结果的因素都已解决、被界定,或作为不确定性保留下来时,最终标签才有依据。首先,在固定Agent动作的受控回放中,每个延迟操作的终点标签与最终标签都不同;当服务状态在运行间持续存在时,延迟写入会改变下一次运行的分数,而隔离或经验证的重置之后则不会。其次,我们审查十个公开协议,发现它们都说明了运行何时停止及对什么评分,但对未完成操作以及将不同运行视为独立试验的证据,记录不够一致。最后,我们提出开放效应记录,列出终点之后仍可能相关的操作或资源、其当前状态,以及它们能否改变被评分结果或影响另一次运行。