论文

你知道我指什么:智能体对话指代定位基准

You Know What I Mean: A Benchmark for Agentic Conversational Reference Grounding

智能体系统Agent任务评测

摘要

协作对话常间接指代外部内容,例如“这像昨天讨论的修复”,需要结合对话与可通过API或界面访问的工作区证据。本文将问题定义为对话指代定位CoRG:用给定工具找到说话者意图指向的唯一外部条目。词汇、语义与时间线索分散在对话及工作区,智能体需制定搜索策略、发现候选、检查元数据和内容并排除相近条目。RepoRef包含来自92个仓库、指向GitHub问题、拉取请求和提交的400段开发者聊天。与单次检索不同,往往需要多步工具调用。最佳智能体成功率仅67.0%,仍有三分之一指代未解决。该基准用于研究智能体在真实多工具环境中的搜索、检查与核验。