论文

跳出框框思考:语言模型可以选择性地依赖外部指导吗?

Thinking Outside the Box: Can Language Models Rely on External Guidance Selectively?

模型评测基准与评测资源

摘要

Agent Harness通常通过人为设计的工作流程来改进语言模型,但随着模型的功能变得越来越强大,不可靠的指导可能会越来越限制其执行。我们称之为从有用的指导中受益,同时推翻不可靠的指导思维的能力。我们引入了 Box$^2$-Bench,它固定模型和任务,同时改变工作流程的可靠性,以隔离模型如何调节其对指导的依赖。在 Box$^2$-Bench 上,前沿模型通常受益于可靠的指导,但当指导存在误导或变得不可靠时,仍然容易受到攻击。为了测试是否可以学习这种能力,我们使用不良工作流程训练两个开放权重模型,并保留良好的工作流程进行评估。我们探索了两种互补的训练策略:反事实监督微调提高了鲁棒性,而基于结果的强化学习可以将平衡转向更多地使用有用的工作流程。我们进一步发现,这种行为超出了工作流程,扩展到其他形式的外部信息,从而提高了同行纠正和对损坏内存的鲁棒性。总之,我们的结果表明,对易出错的外部信息的选择性依赖是Agent可靠性的一个维度,不能仅通过任务绩效来衡量。