论文
从画像到合成:评测个性化LLM Agent的隐式行为对齐
From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents
摘要
大语言模型使自主代理的能力日益增强,但个性化仍对这些代理的实际实用性至关重要。最近的基准测试已经开始评估代理的个性化,但它们主要依赖于静态偏好快照、固定的交互记录或预定义用户角色上的问题回答。这些设计未能捕捉到用户偏好的动态变化和偏好条件下的任务执行,我们称之为知识到行动差距。为解决这一挑战,我们引入了IBA-Bench,这是一个从包含噪声、隐含线索和时间一致性偏差的历史交互记录中构建的隐性行为对齐基准。与之前的 工作不同,IBA-Bench 评估了代理是否能够在满足历史交互中推断出的隐性用户约束的情况下执行任务。我们进一步提出了IBA-Agent,这是一个通过广泛的检索和轨迹级对齐来协调冲突优先级的代理框架。在IBA-Bench上的实验结果表明,对于最先进的LLM代理,有效的人性化仍然是一个显著的挑战,而提出的IBA-Agent 在跨九个应用领域的复杂场景中显著改善了行为对齐。
