论文

$\tau$-知识:通过非结构化知识评估会话代理

$\tau$-Knowledge: Evaluating Conversational Agents over Unstructured Knowledge

智能体系统Agent任务评测长程任务评测

摘要

对话智能体日益部署于知识密集场景,正确行为依赖在与用户实时交互中检索并运用来自大型、专有、非结构化语料的领域知识。然而,多数既有基准彼此独立地评估检索或工具使用,在对非结构化数据的长程交互、完全 Agentic 评估上留下空白。我们提出 τ-Knowledge,τ-Bench 的扩展,用于评估智能体在成功取决于协调外部自然语言知识与工具输出、以产生可验证且合规状态变化的环境中的表现。我们的新领域 τ-Banking 模拟真实的金融科技客服工作流,智能体须在约 700 份互相关联的知识文档中导航,同时执行经工具中介的账户更新。在嵌入检索与终端搜索两类方式下,即使高推理预算的前沿模型也仅取得约 25.5% 的 pass^1,且可靠性随重复试验急剧下降。智能体难以从稠密互链的知识库中检索正确文档,也难以对复杂内部政策做准确推理。总体而言,τ-Knowledge 为开发在面向人类部署中整合非结构化知识的智能体提供了现实测试平台。

τ-Knowledge:评估对话智能体对非结构化知识的使用
图1:τ \tau -Banking领域概览。智能体必须与知识库交互以获取程序性知识、政策、工具与业务产品,从而通过调用所发现的、能修改底层数据库的工具来解决复杂的用户请求。右侧示例展示了一个智能体协助丢失装有银行卡的钱包的用户:尽管用户最初请求冻结该卡,但针对该卡的政策与交易历史约束要求智能体改为注销该卡。