论文
CL-bench Life:语言模型可以从现实生活中学习吗?
CL-bench Life: Can Language Models Learn from Real-Life Context?
摘要
当今的 AI 助手(例如 OpenClaw)旨在有效地处理上下文,使上下文学习成为模型日益重要的功能。随着这些系统超越专业环境进入日常生活,它们必须处理的环境的性质也发生了变化。现实生活中的情境往往是混乱的、支离破碎的,并且与个人和社会经历紧密相关,例如多方对话、个人档案和行为痕迹。然而,目前尚不清楚当前的前沿语言模型是否能够可靠地从此类上下文中学习并解决基于它们的任务。为此,我们推出了 CL-bench Life,这是一个完全由人工策划的基准测试,包含 405 个上下文任务对和 5,348 个验证标准,涵盖常见的现实生活场景。解决 CL-bench Life 中的任务需要模型对复杂、混乱的现实生活环境进行推理,需要强大的现实生活环境学习能力,远远超出现有基准测试中评估的能力。我们评估了 10 个前沿 LM,发现现实生活中的上下文学习仍然极具挑战性:即使是性能最好的模型也只能实现 19.3% 的任务解决率,而跨模型的平均性能仅为 13.8%。模型仍然难以对混乱的群聊历史和日常生活中零散的行为记录等上下文进行推理。 CL-bench Life 为推进现实生活情境学习提供了一个重要的测试平台,其进步可以在日常生活中实现更智能、更可靠的人工智能助手。