论文

FIRE:面向可靠语言模型Agent的失败知情运行时工程

FIRE: Failure-Informed Runtime Engineering for Reliable Language-Model Agents

智能体系统Agent Harness

摘要

语言模型Agent常常能得到一个可行的解决方案,却无法稳定地交付它。我们研究运行时策略:由Agent harness在曾先于观测失败出现的状态上施加的有针对性自然语言指令与动作拒绝,不改变模型权重或用户提示。借助这种方式,在能力保持不变的情况下,我们观察到交付可靠性的显著解锁。在完整的87任务Terminal-Bench 2.1套件、每任务两次尝试的设置下,策略在GPT-5.6的三个档位上都提升了重复成功率(pass^2):Luna从50.6%升至54.0%,Terra从55.2%升至60.9%,Sol从64.4%升至73.6%。Sol的两次取最优成功率仅变化1.2个百分点,而重复成功率上升9.2个百分点,表明策略主要把可达成的解转化为可靠的交付。我们进一步在Terra的冻结组合下覆盖14个任务:策略引导的Terra达到71.4%,而无辅助的Sol为64.3%,成本约为一半,展示了围绕模型的工程如何为一个用例解锁可靠性。为隔离机制,我们运行一个随机化五臂实验:真实策略在合格任务上达到61%,而无策略为39%、时间匹配的假策略为36%、通用验证或重新考虑策略为39%至43%。在24个被编码的策略尝试中有22个出现了预期的纠正行为,而任何其他臂中至多14个。因此,运行时策略是一种实用的可靠性层:它们使Agent已具备的能力显著更可重复。