论文
$\tau$-知识:通过非结构化知识评估会话代理
$\tau$-Knowledge: Evaluating Conversational Agents over Unstructured Knowledge
摘要
对话智能体日益部署于知识密集场景,正确行为依赖在与用户实时交互中检索并运用来自大型、专有、非结构化语料的领域知识。然而,多数既有基准彼此独立地评估检索或工具使用,在对非结构化数据的长程交互、完全 Agentic 评估上留下空白。我们提出 τ-Knowledge,τ-Bench 的扩展,用于评估智能体在成功取决于协调外部自然语言知识与工具输出、以产生可验证且合规状态变化的环境中的表现。我们的新领域 τ-Banking 模拟真实的金融科技客服工作流,智能体须在约 700 份互相关联的知识文档中导航,同时执行经工具中介的账户更新。在嵌入检索与终端搜索两类方式下,即使高推理预算的前沿模型也仅取得约 25.5% 的 pass^1,且可靠性随重复试验急剧下降。智能体难以从稠密互链的知识库中检索正确文档,也难以对复杂内部政策做准确推理。总体而言,τ-Knowledge 为开发在面向人类部署中整合非结构化知识的智能体提供了现实测试平台。
