论文
使用推理代理进行大规模反例引导学习
Counterexample Guided Learning in the Large using Reasoning Agents
摘要
LLM 和 LLM 代理应该在给出反馈时进行改进,但确定它们何时能够做到这一点很困难:反馈是异构的、特定于领域的并且难以控制。我们通过要求 LLM 执行正则表达式归纳来应对这一挑战,这是一个经典的符号学习问题,其中精确的反馈机制以反例的形式存在。在反例引导学习中,学习者(LLM)从正/负标签字符串中提出候选正则表达式,教师(验证者)返回反例来展示候选语言和目标语言之间的差异。我们确定了新颖的反例引导的细化策略,可以实现有效的正则表达式学习,例如正则化和符号反例集群。我们还探索代理策略,例如反射和修复循环。根据经验,我们发现验证者反馈极大地提高了具有挑战性的正则表达式归纳任务的样本效率,减少了所需的标记示例的数量,并能够在标准提示失败的情况下学习复杂的目标表达式。例如,在最困难的任务组上,我们的反例引导框架将成功率从 3.2% 提高到 38.1%,在两个不同的正则表达式域上将成功率从 38.9% 提高到 74.1%。这些结果表明,LLM 可以从丰富的反馈中受益,而不仅仅是将其视为附加数据,从而为基于 LLM 的程序合成和形式推理的稳健验证者引导方法打开了大门。