论文
Harness安全自进化:可行性与边界的理论分析
Safe Harness Self-Evolution: A Theoretical Analysis of Feasibility and Limits
摘要
利用自我进化是智能体修改其提示、工具、代码或编排以响应任务反馈的过程,同时保持底层语言模型冻结,并且更改在后续任务中持续存在。我们对Harness自我进化的可行性和局限性、连接修改生成、有限数据认证和选择、安全采用以及更新后的行为进行了系统的理论分析。在固定的用户任务分布下,我们建立了保证总体预期奖励改进的条件,同时控制保留任务的变化,描述生成合格修改的概率,并导出用于安全选择和采用的有限数据界限。我们的分析表明,生成和认证施加了明显的约束:当前的任务性能并不能决定生成合格修改的概率,并且当评估受到限制时,生成更多候选者不需要提高成功更新的保证。因此,即使存在改进机会,也可能出现停滞。我们进一步表明,随着预期奖励接近其上限,识别真正改进的最坏情况评估成本会有所不同。在连续的更新中,经过认证的改进保证会在有限的运行中累积,但成功的更新本身并不能保证进一步的改进仍然是可能的。这些结果为诊断瓶颈和设计更安全的自我进化机制提供了基础。