论文
AgentHabit:描述Agent在日常任务中的独特行为
AgentHabit: Characterizing Distinct Behaviors of Agents on Everyday Tasks
摘要
大语言模型 (LLM) Agent可帮助用户完成可以通过多种合理方式完成的日常任务。即使他们的答案有用,Agent执行这些任务的方式也可能不符合用户的偏好和需求。例如,Agent在是否提出澄清问题或搜索网络方面有所不同。我们引入了习惯,这是一个包含 5 个类别 23 个行为轴的分类法,由三位作者和三位LLM从 17 个领域的 408 个Agent轨迹中自下而上得出。在保留任务上,HABIT 比现有的人类价值观和Agent行为分类法更清楚地区分模型,同时支持相对一致的注释。在 HABIT 的基础上,我们构建了 AgentHABIT,这是一个基准,根据 86 项日常任务的轨迹来描述每个智能体的行为倾向。使用 AgentHABIT 分析 18 个模型揭示了一系列独特的趋势。例如,大多数 GPT 和 Claude 模型都会陈述其假设,并在需求发生冲突时提供替代方案,而 Qwen 和 Google 的模型则更经常不陈述假设或对需求的更改。即使从完全不同的任务集构建时,这些配置文件仍然可以识别,这表明它们反映了一般趋势而不是特定于任务的行为。提示Agent采取特定行为很容易改变一些轴,但几乎不会改变其他轴,而对另一个模型的轨迹进行微调只会改变模型轮廓的一部分,并保持其大部分完整。总体而言,HABIT 和 AgentHABIT 提供了一个系统框架,用于描述Agent如何执行任务成功之外的日常任务,并提供见解来指导行为更适合用户需求的Agent的开发。