论文
“我不知道”过滤器:增强函数调用中的代理可靠性
The "I Don't Know" Filter: Enhancing Agentic Reliability in Function Calling
摘要
支持代理的语言模型在函数调用基准测试中的性能迅速提高。然而,这些模型的训练和评估中使用的指标通常会鼓励模型即使在答案不确定的情况下也做出积极的主张,从而导致幻觉。当语言模型被信任使用函数调用在高风险应用程序中做出决策时,这种幻觉可能是灾难性的。为此,我们提出了一种代理评估指标,该指标考虑了与不正确的函数调用相关的负面结果。此外,为了在幻觉造成伤害之前捕获它们,我们提出了一种轻量级的可训练过滤器,它可以量化语言模型的不确定性并消除潜在有害的函数调用。通过训练该过滤器在不修改底层模型的情况下检测和抑制不确定的函数调用,我们展示了一条通往知道何时说“我不知道”的代理的实用路径,我们认为这一属性对于生产可靠性至关重要。